weken.news
ai剪輯claude-code工作流ffmpeg自動化

AI 剪影片品質不穩怎麼解決?把一支 AI 拆成九個角色的實測紀錄

直接回答

AI 剪影片品質不穩,多半不是模型不夠強,是一支 AI 被要求同時做完太多種判斷。我把流程拆成九個角色(環境、辨識、語意校正、內容規劃、剪輯、交件、運鏡、B-roll、動畫),每個只做一件事,並且把所有內容判斷集中在同一棒、其他棒只負責執行。拆完之後最明顯的差別是失敗變得可歸因:哪一棒做壞、量到什麼數字、該退回誰重做,全部看得出來。

週末哥 ·

我先做的版本是一支 AI 從頭剪到尾。

丟一支口播毛片進去,它辨識、砍廢話、排順序、剪接、配字幕、疊動畫,一路做完。

聽起來很理想,實際用起來的問題是:剪出來時好時壞,而且我說不出為什麼。

同樣一套流程,這支能用,下一支就整段重來。想修的時候才發現無從下手,因為我不知道是哪一步做壞的。

問題不在模型不夠強。是我讓一支 AI 同時做兩種完全不同的工作。

一種是要讀懂內容才能決定的:這句話是廢話還是重點、哪一句該配畫面、哪一句要留著看到人的表情。

另一種是要精確量測才做得對的:切點落在第幾格、說話音量的中位數是多少、字幕的字每秒幾個字。

這兩種混在一起,失敗就變成不可歸因。

所以我把它拆成九個角色,每個只做一件事。

第 0 棒檢查環境,缺什麼當場裝。第 1 棒只做辨識,抓幻聽、機械斷行,不碰語意。第 2 棒只改聽錯的字,不准潤稿、不准改順序。

第 3 棒是判斷最集中的一棒:句子順序、砍哪幾段、每句用多近的距離看人、哪幾句畫面換成素材、哪幾句疊資訊卡。

第 4 棒照那份規劃剪。第 5 棒量完把成品交出去給人看。第 6 到 8 棒是運鏡、B-roll、動畫,全部只負責執行,做不到要講出來。

拆開之後最有價值的不是效率,是每一次失敗都有地址。

我可以說出「第 4 棒的第 7 段能量只剩 88%」,然後只叫剪輯那一棒重做,不用整條重跑。

而且判斷集中在一棒之後,執行棒不需要猜。

最能說明「猜」有多不可靠的是動畫那一棒。

它原本用 13 條正規式判斷每句話在講什麼:講到百分比就配長條圖、講到「不用」就蓋 NO 印章、講到留言加三位數字就配數字跳動。

我拿一支 18 句的影片實測,只有 3 句中規則。

更糟的是,我去查實作的卡型有 19 種,而那 13 條規則只涵蓋得到 13 種。有 6 種是任何句子都挑不到的,它們寫在程式裡但從來沒有出現過。

正規式做的事情叫語意判斷。那是要讀完整份稿子的人才做得到的,不是多寫十條規則能解決的。

第二個實測是 B-roll 的單位。

我原本以為一句話配一個素材最直覺。實際算才發現不行。

那支 19 段的影片,平均每段只有 1.53 秒,而長過 2 秒的只有 3 段。一個鏡頭至少要活 2 秒才不會變成閃頻,這是我原本就寫在檢查裡的門檻。

如果一句配一個素材去湊 60% 的覆蓋率,要換掉 10 段,平均每 2 秒換一次畫面,其中 7 段短於 2 秒。

那不是 B-roll,那是閃頻。

改成把連續幾句合成一個語意組之後,4 組就蓋掉 69%,每組平均 5.4 秒。同樣的覆蓋率,鏡頭數從 10 個降到 4 個。

第三件事是我原本沒預期的:程式的檢查跟人的眼睛,抓到的東西幾乎不重疊。

那天的記分板是四比零。

真正被抓到的四個問題是畫面有故意的卡頓、有幾段剪到尾音、字幕少一個字、結尾多兩個字,全部是人聽出來看出來的。

而我的程式檢查每一項都報通過。

它量的是削字比例、掉格數、下刀有沒有切到說話聲,那些都是代理指標。人量的是真正的觀看體驗,而一支 37 秒的片子本來就會被看完。

所以我把那道品質閘改名叫交件員:它量完之後把成品交出去,附一張「值得看一眼的地方」,只有事實問題才硬擋(上游過期、核准的字沒進字幕)。原本的量測全部留著,用途改成回歸測試,改完程式跑一次確認沒改壞。

最後拿三支毛片實測一次完整流程。

三支影格率不一致(兩支 60、一支 59.94),直接接會音畫慢慢失步,所以先統一成 1080x1920 三十格再接成一支 128 秒的毛片。

辨識出 25 句,砍掉 4 句試講跟重複,第 3 棒再砍 2 句過渡語,留 19 句剪成 45.3 秒。

B-roll 五組蓋掉 71%,動畫三張,字幕跟核准的稿一字不差 267 個字。

過程中被接觸表擋下兩組素材:一組是很暗的機房而且有人的背影,一組是綠幕沒去乾淨、畫面上有綠色的手臂。那種錯只有眼睛看得出來,所以抓素材跟套用之間一定要停下來看一張接觸表。

拆成九個角色之後,我學到的其實跟剪片沒有關係。

一個系統會不會穩定,看的不是每一步做得多好,是失敗的時候你有沒有辦法指出是哪一步。

常見問題

為什麼一支 AI 剪出來的影片時好時壞?
因為剪片同時包含兩種完全不同的工作:需要讀懂內容的判斷(哪句該砍、哪句該配畫面)跟需要精確量測的執行(切點在哪、音量門檻多少)。混在一起的時候,你沒辦法知道這次不好是判斷錯了還是量測錯了,也就沒辦法針對性地修。拆開之後每一棒有各自的驗收條件,退回時只重跑那一棒。
用正規式判斷「這句話在講什麼」可行嗎?
實測命中率很低。我原本用 13 條正規式判斷每句該配哪種動畫卡,拿一支 18 句的影片測,只有 3 句中規則。而且實作的 19 種卡型裡有 6 種是任何句子都挑不到的,它們寫了但從來沒出現過。正規式做的其實是語意判斷,而語意判斷要讀完整份稿子才做得準。
B-roll 素材應該一句話配一個嗎?
不行,單位要用語意組不是單句。口播影片一句平均 1.5 秒,而一個鏡頭至少要活 2 秒才不會變成閃頻。我實測那支 19 段的片子,只有 3 段長過 2 秒;如果一句配一個素材去湊 60% 的覆蓋率,要換掉 10 段、其中 7 段短於 2 秒。改成把連續幾句合成一個語意組之後,4 組就蓋掉 69%,每組平均 5.4 秒。
AI 剪片的品質檢查應該由程式做還是人做?
分工要照「量得到 vs 感覺得到」切。程式量的是削字、掉格、下刀有沒有切到說話聲、字幕閱讀速率這類有數字的東西;成品好不好看、節奏會不會讓人滑掉,是人看出來的。我那天的記分板是四比零:真正被抓到的四個問題(畫面卡頓、剪到尾音、少一個字、多兩個字)全部是人聽出來的,而程式的每一項都報通過。
這種九棒流程要花多久建置?
我從第一支測試片到能穩定跑完,實際花了三天。中間大部分時間不是加功能,是拆穿「看起來在把關、實際上永遠會過」的假檢查,還有把每一次做壞的成品變成一條規則。踩過的坑目前累積 50 條,其中最貴的一條花了八小時,原因是一開始把目標設成「減少靜音」而不是「間隔一致」。