AI 剪影片品質不穩怎麼解決?把一支 AI 拆成九個角色的實測紀錄
直接回答
AI 剪影片品質不穩,多半不是模型不夠強,是一支 AI 被要求同時做完太多種判斷。我把流程拆成九個角色(環境、辨識、語意校正、內容規劃、剪輯、交件、運鏡、B-roll、動畫),每個只做一件事,並且把所有內容判斷集中在同一棒、其他棒只負責執行。拆完之後最明顯的差別是失敗變得可歸因:哪一棒做壞、量到什麼數字、該退回誰重做,全部看得出來。
我先做的版本是一支 AI 從頭剪到尾。
丟一支口播毛片進去,它辨識、砍廢話、排順序、剪接、配字幕、疊動畫,一路做完。
聽起來很理想,實際用起來的問題是:剪出來時好時壞,而且我說不出為什麼。
—
同樣一套流程,這支能用,下一支就整段重來。想修的時候才發現無從下手,因為我不知道是哪一步做壞的。
問題不在模型不夠強。是我讓一支 AI 同時做兩種完全不同的工作。
一種是要讀懂內容才能決定的:這句話是廢話還是重點、哪一句該配畫面、哪一句要留著看到人的表情。
另一種是要精確量測才做得對的:切點落在第幾格、說話音量的中位數是多少、字幕的字每秒幾個字。
這兩種混在一起,失敗就變成不可歸因。
—
所以我把它拆成九個角色,每個只做一件事。
第 0 棒檢查環境,缺什麼當場裝。第 1 棒只做辨識,抓幻聽、機械斷行,不碰語意。第 2 棒只改聽錯的字,不准潤稿、不准改順序。
第 3 棒是判斷最集中的一棒:句子順序、砍哪幾段、每句用多近的距離看人、哪幾句畫面換成素材、哪幾句疊資訊卡。
第 4 棒照那份規劃剪。第 5 棒量完把成品交出去給人看。第 6 到 8 棒是運鏡、B-roll、動畫,全部只負責執行,做不到要講出來。
—
拆開之後最有價值的不是效率,是每一次失敗都有地址。
我可以說出「第 4 棒的第 7 段能量只剩 88%」,然後只叫剪輯那一棒重做,不用整條重跑。
而且判斷集中在一棒之後,執行棒不需要猜。
—
最能說明「猜」有多不可靠的是動畫那一棒。
它原本用 13 條正規式判斷每句話在講什麼:講到百分比就配長條圖、講到「不用」就蓋 NO 印章、講到留言加三位數字就配數字跳動。
我拿一支 18 句的影片實測,只有 3 句中規則。
更糟的是,我去查實作的卡型有 19 種,而那 13 條規則只涵蓋得到 13 種。有 6 種是任何句子都挑不到的,它們寫在程式裡但從來沒有出現過。
正規式做的事情叫語意判斷。那是要讀完整份稿子的人才做得到的,不是多寫十條規則能解決的。
—
第二個實測是 B-roll 的單位。
我原本以為一句話配一個素材最直覺。實際算才發現不行。
那支 19 段的影片,平均每段只有 1.53 秒,而長過 2 秒的只有 3 段。一個鏡頭至少要活 2 秒才不會變成閃頻,這是我原本就寫在檢查裡的門檻。
如果一句配一個素材去湊 60% 的覆蓋率,要換掉 10 段,平均每 2 秒換一次畫面,其中 7 段短於 2 秒。
那不是 B-roll,那是閃頻。
改成把連續幾句合成一個語意組之後,4 組就蓋掉 69%,每組平均 5.4 秒。同樣的覆蓋率,鏡頭數從 10 個降到 4 個。
—
第三件事是我原本沒預期的:程式的檢查跟人的眼睛,抓到的東西幾乎不重疊。
那天的記分板是四比零。
真正被抓到的四個問題是畫面有故意的卡頓、有幾段剪到尾音、字幕少一個字、結尾多兩個字,全部是人聽出來看出來的。
而我的程式檢查每一項都報通過。
它量的是削字比例、掉格數、下刀有沒有切到說話聲,那些都是代理指標。人量的是真正的觀看體驗,而一支 37 秒的片子本來就會被看完。
所以我把那道品質閘改名叫交件員:它量完之後把成品交出去,附一張「值得看一眼的地方」,只有事實問題才硬擋(上游過期、核准的字沒進字幕)。原本的量測全部留著,用途改成回歸測試,改完程式跑一次確認沒改壞。
—
最後拿三支毛片實測一次完整流程。
三支影格率不一致(兩支 60、一支 59.94),直接接會音畫慢慢失步,所以先統一成 1080x1920 三十格再接成一支 128 秒的毛片。
辨識出 25 句,砍掉 4 句試講跟重複,第 3 棒再砍 2 句過渡語,留 19 句剪成 45.3 秒。
B-roll 五組蓋掉 71%,動畫三張,字幕跟核准的稿一字不差 267 個字。
過程中被接觸表擋下兩組素材:一組是很暗的機房而且有人的背影,一組是綠幕沒去乾淨、畫面上有綠色的手臂。那種錯只有眼睛看得出來,所以抓素材跟套用之間一定要停下來看一張接觸表。
—
拆成九個角色之後,我學到的其實跟剪片沒有關係。
一個系統會不會穩定,看的不是每一步做得多好,是失敗的時候你有沒有辦法指出是哪一步。