拆解IG爆款創作者的版面節奏:我用人臉偵測逐格量出全屏只佔20%
直接回答
用人臉偵測逐格分類一支80.8秒的IG爆款影片後,量出全屏畫面只佔20%(15.5秒)、分割版面佔80%(63.8秒)、全片切換7次、平均每段11.3秒。切換不是隨機交替:講事實、講數據、講流程時用分割版面,講感受、看鏡頭講給你聽時切全屏。另外分割版面的比例是人像框佔畫面70%、上方面板只佔29%,跟直覺相反。
想模仿 IG 上那種「上方動畫加下方人像框」的短影音,最難的不是做出版面,是不知道什麼時候該切回全屏。
我用 OpenCV 的 YuNet 人臉偵測,逐格分類一支 80.8 秒的爆款影片,量出來的結果是:全屏只佔 20%(15.5 秒),分割版面佔 80%(63.8 秒),全片切換 7 次,平均每段 11.3 秒。
比例只是表面。真正能複製的是切換的時機:講事實用分割,講心情用全屏。
為什麼要用量的,不用看的
模仿參考影片最常見的失敗,是憑印象抄。看完覺得「她好像一直在切版面」,做出來就變成每隔幾秒切一次,結果又快又亂。
而且憑印象抄不出比例。我第一版做的分割版面是上方面板 61%、人像框 36%,做完自己看不出問題,交出去被直接說「下方區塊太小了,上方太大了,所以才會很醜」。
回頭去量參考影片,人像框是 70%、上方只有 29%。剛好反過來。
量測一支80.8秒的IG爆款影片:全屏15.5秒佔20%,分割版面63.8秒佔80%,切換7次,平均每段11.3秒。分割版面的比例是人像框70%、上方面板29%。
—
量測方法:找一個可以自動分類的特徵
要讓程式分辨「這一格是全屏還是分割版面」,需要一個明確的視覺特徵。
我用的是臉在畫面的垂直位置:分割版面時人被塞在下方的小框裡,臉的位置很低;全屏時臉在畫面中上。
用 cv2.FaceDetectorYN 逐格偵測,臉中心在畫面 55% 以上算全屏,其餘算分割。再把連續同類的格子合併成段,過濾掉短於 0.6 秒的雜訊,就得到完整的段落表。
補一句踩過的坑:OpenCV 5 已經移除 CascadeClassifier,也不再附 Haar 的 XML 模型檔。要做人臉偵測只能用 YuNet,模型檔 228KB 放本機就好,對角度的耐受度也比 Haar 好。
—
量出來的段落表
| 時間 | 長度 | 版面 |
|---|---|---|
| 0.3 - 5.3 | 5.0 秒 | 分割 |
| 5.5 - 10.0 | 4.5 秒 | 全屏 |
| 10.1 - 19.6 | 9.5 秒 | 分割 |
| 19.8 - 27.8 | 8.0 秒 | 全屏 |
| 28.0 - 47.8 | 19.8 秒 | 分割 |
| 48.0 - 51.0 | 3.0 秒 | 全屏 |
| 51.1 - 80.6 | 29.5 秒 | 分割 |
規律是:每 10 到 20 秒穿插一次全屏,每次 3 到 8 秒。
分割版面的段落可以很長(最長 29.5 秒),全屏永遠是短的。全屏是強調,不是常態。
—
比例不是重點,時機才是
把切換點對回影片內容看,會發現全屏出現的位置有共通性:都是她在講感受、講判斷、看著鏡頭跟你說話的時候。
而分割版面出現的位置,是在講資訊、講數據、講流程。
這條規律比 20% 這個數字有用得多,因為它可以直接套到自己的內容上:
- 訪問者提問 → 全屏(那是對話,要看到人)
- 受訪者報數字 → 分割(上方放數字動畫)
- 講痛點清單 → 分割(上方放清單圖)
- 講「我覺得」「我很慶幸」 → 全屏(臉大才有情緒)
- 結尾 CTA → 看情況,要放品牌卡就分割
我照這條規律重排自己的影片,全屏佔 21%,跟參考片的 20% 幾乎一樣,但完全不是抄它的時間點,是照自己的內容排出來的。
—
切換為什麼會卡:跳接
版面照語意排好之後,還是被指出「切換過程都怪怪的,會先閃現一個不順的畫面」。
先確認一件事:整支影片零黑格,我全片掃過。第一次抽格看到黑畫面是抽格方式造成的假象(ffmpeg 的 -ss 放在 -i 前面會 seek 到關鍵影格前)。
真正的原因是跳接。同一個人用兩種取景硬切,大小位置突然變,眼睛一定會覺得卡。
解法是讓版面只在「鏡頭本來就切了」的地方換。把所有鏡頭切點的時間算出來,版面切換點全部對齊上去,版面換的那一格畫面本來就在換,兩件事合成一次剪接。
對齊之後,6 個切點裡有 4 個剛好落在「換人講話」的位置(男生問問題切到女生回答),那種切最自然,因為觀眾本來就預期換人時畫面會變。
有一個切換點對不齊:它前後 4 秒內都沒有任何鏡頭切點。硬對齊會讓它跟前一段黏成 15.6 秒的全屏,還會吃掉中間該有的動畫。所以那一段整段給分割版面,不硬切。全屏因此從 4 段變 3 段。
版面切換要對齊到鏡頭本來就切的地方。同一個人用兩種取景硬切是跳接,一定會卡。對齊後6個切點有4個落在換人講話的位置,那種切最自然。
—
結論:可以量的東西不要用猜的
模仿一支影片的時候,最容易抄到的是表面(有分割版面、有動畫、有字幕),最難抄到的是節奏。而節奏是可以量的。
方法很簡單:先想一個能自動分類的視覺特徵,逐格跑一遍,把結果合併成段落,再回頭看每個切換點在講什麼。
量出比例只是第一層。第二層是「什麼內容配什麼版面」的對應關係,那個才是能搬到自己內容上的東西。20% 這個數字換一支影片就不一樣了,但「講事實用分割、講心情用全屏」不會變。