weken.news
短影音instagramopencv影片剪輯版面設計

拆解IG爆款創作者的版面節奏:我用人臉偵測逐格量出全屏只佔20%

直接回答

用人臉偵測逐格分類一支80.8秒的IG爆款影片後,量出全屏畫面只佔20%(15.5秒)、分割版面佔80%(63.8秒)、全片切換7次、平均每段11.3秒。切換不是隨機交替:講事實、講數據、講流程時用分割版面,講感受、看鏡頭講給你聽時切全屏。另外分割版面的比例是人像框佔畫面70%、上方面板只佔29%,跟直覺相反。

週末哥 ·

想模仿 IG 上那種「上方動畫加下方人像框」的短影音,最難的不是做出版面,是不知道什麼時候該切回全屏。

我用 OpenCV 的 YuNet 人臉偵測,逐格分類一支 80.8 秒的爆款影片,量出來的結果是:全屏只佔 20%(15.5 秒),分割版面佔 80%(63.8 秒),全片切換 7 次,平均每段 11.3 秒。

比例只是表面。真正能複製的是切換的時機:講事實用分割,講心情用全屏。

為什麼要用量的,不用看的

模仿參考影片最常見的失敗,是憑印象抄。看完覺得「她好像一直在切版面」,做出來就變成每隔幾秒切一次,結果又快又亂。

而且憑印象抄不出比例。我第一版做的分割版面是上方面板 61%、人像框 36%,做完自己看不出問題,交出去被直接說「下方區塊太小了,上方太大了,所以才會很醜」。

回頭去量參考影片,人像框是 70%、上方只有 29%。剛好反過來。

量測一支80.8秒的IG爆款影片:全屏15.5秒佔20%,分割版面63.8秒佔80%,切換7次,平均每段11.3秒。分割版面的比例是人像框70%、上方面板29%。

量測方法:找一個可以自動分類的特徵

要讓程式分辨「這一格是全屏還是分割版面」,需要一個明確的視覺特徵。

我用的是臉在畫面的垂直位置:分割版面時人被塞在下方的小框裡,臉的位置很低;全屏時臉在畫面中上。

cv2.FaceDetectorYN 逐格偵測,臉中心在畫面 55% 以上算全屏,其餘算分割。再把連續同類的格子合併成段,過濾掉短於 0.6 秒的雜訊,就得到完整的段落表。

補一句踩過的坑:OpenCV 5 已經移除 CascadeClassifier,也不再附 Haar 的 XML 模型檔。要做人臉偵測只能用 YuNet,模型檔 228KB 放本機就好,對角度的耐受度也比 Haar 好。

量出來的段落表

時間長度版面
0.3 - 5.35.0 秒分割
5.5 - 10.04.5 秒全屏
10.1 - 19.69.5 秒分割
19.8 - 27.88.0 秒全屏
28.0 - 47.819.8 秒分割
48.0 - 51.03.0 秒全屏
51.1 - 80.629.5 秒分割

規律是:每 10 到 20 秒穿插一次全屏,每次 3 到 8 秒。

分割版面的段落可以很長(最長 29.5 秒),全屏永遠是短的。全屏是強調,不是常態。

比例不是重點,時機才是

把切換點對回影片內容看,會發現全屏出現的位置有共通性:都是她在講感受、講判斷、看著鏡頭跟你說話的時候。

而分割版面出現的位置,是在講資訊、講數據、講流程。

這條規律比 20% 這個數字有用得多,因為它可以直接套到自己的內容上:

  • 訪問者提問 → 全屏(那是對話,要看到人)
  • 受訪者報數字 → 分割(上方放數字動畫)
  • 講痛點清單 → 分割(上方放清單圖)
  • 講「我覺得」「我很慶幸」 → 全屏(臉大才有情緒)
  • 結尾 CTA → 看情況,要放品牌卡就分割

我照這條規律重排自己的影片,全屏佔 21%,跟參考片的 20% 幾乎一樣,但完全不是抄它的時間點,是照自己的內容排出來的。

切換為什麼會卡:跳接

版面照語意排好之後,還是被指出「切換過程都怪怪的,會先閃現一個不順的畫面」。

先確認一件事:整支影片零黑格,我全片掃過。第一次抽格看到黑畫面是抽格方式造成的假象(ffmpeg 的 -ss 放在 -i 前面會 seek 到關鍵影格前)。

真正的原因是跳接。同一個人用兩種取景硬切,大小位置突然變,眼睛一定會覺得卡。

解法是讓版面只在「鏡頭本來就切了」的地方換。把所有鏡頭切點的時間算出來,版面切換點全部對齊上去,版面換的那一格畫面本來就在換,兩件事合成一次剪接。

對齊之後,6 個切點裡有 4 個剛好落在「換人講話」的位置(男生問問題切到女生回答),那種切最自然,因為觀眾本來就預期換人時畫面會變。

有一個切換點對不齊:它前後 4 秒內都沒有任何鏡頭切點。硬對齊會讓它跟前一段黏成 15.6 秒的全屏,還會吃掉中間該有的動畫。所以那一段整段給分割版面,不硬切。全屏因此從 4 段變 3 段。

版面切換要對齊到鏡頭本來就切的地方。同一個人用兩種取景硬切是跳接,一定會卡。對齊後6個切點有4個落在換人講話的位置,那種切最自然。

結論:可以量的東西不要用猜的

模仿一支影片的時候,最容易抄到的是表面(有分割版面、有動畫、有字幕),最難抄到的是節奏。而節奏是可以量的。

方法很簡單:先想一個能自動分類的視覺特徵,逐格跑一遍,把結果合併成段落,再回頭看每個切換點在講什麼。

量出比例只是第一層。第二層是「什麼內容配什麼版面」的對應關係,那個才是能搬到自己內容上的東西。20% 這個數字換一支影片就不一樣了,但「講事實用分割、講心情用全屏」不會變。

常見問題

短影音的上下分割版面,上面跟下面各要多高?
量爆款影片的結果是人像框佔畫面70%(y座標564到1916)、上方面板只佔29%。跟直覺相反,上方那塊只是放動畫的背景,人才是主角。我第一版做成上方61%、人像框36%,被直接指出「下方太小上方太大所以很醜」。如果上方要放清單或雙條對照圖這種需要高度的內容,可以放寬到40:60,但不建議到50:50,那樣人像框會變成橫的,在直式手機上人不夠大。
什麼時候該切全屏,什麼時候用分割版面?
規律是:講事實、講數據、講流程用分割版面(上方有空間放圖表跟數字),講感受、講判斷、直接看鏡頭講給觀眾聽的時候切全屏(臉大才有情緒衝擊)。不是每隔幾秒交替一次。量出來的節奏是每10到20秒穿插一次全屏,每次3到8秒。
怎麼用程式量別人影片的版面節奏?
用OpenCV的YuNet人臉偵測(cv2.FaceDetectorYN)逐格跑,判斷臉在畫面的垂直位置。分割版面時臉落在下方的人像框裡,全屏時臉在畫面中上。設一個門檻把每一格分成兩類,再把連續同類的合併成段落,就能算出比例、切換次數、平均段落長度。整支80.8秒的影片幾分鐘就跑完。
為什麼版面切換會覺得卡卡的?
因為同一個人用兩種取景硬切就是跳接,大小位置突然變,眼睛一定會覺得不順。解法是讓版面只在「鏡頭本來就切了」的地方換:先算出所有鏡頭切點的時間,再把版面切換點對齊上去,這樣版面換的那一格畫面本來就在換,兩件事合成一次剪接。實作後6個切點有4個剛好落在換人講話的位置,那種切最自然。
OpenCV 5為什麼不能用Haar做人臉偵測?
OpenCV 5已經移除CascadeClassifier並且不再附帶Haar的XML模型檔。改用YuNet(cv2.FaceDetectorYN),模型檔只有228KB可以放在本機,而且對側臉跟角度的耐受度比Haar好,適合影片逐格跑。