你可能已經會寫指令、也試過幾個模型,生出來的片段看起來都不錯。但一到要剪成完整影片、交給老闆或客戶,就開始卡:少了鏡頭、聲音對不上,對方要字幕檔,你手上只有燒好字幕的影片。
我是工程背景,拍了十年制服人像,但沒念過影視。做了幾輪 AI 影片後我發現,最弱的不是指令,而是影視圈覺得理所當然的那些事。
- 生成只是八站裡的一站:前面有需求、腳本、分鏡,後面有剪輯、聲音、字幕和交件。
- 核准不是不能改:而是改的時候,知道會牽動哪幾步、要多花多少。
- 每一格分鏡至少回答七件事:用 AI 生成,還要再加參考圖和「看到什麼才算過」。
- 交付規格要先寫下來:尺寸、幀率、聲音、字幕檔、無字版,最後一公里最容易出包。
這篇整理自一份接案教學手冊,加上我自己踩過的坑。手冊的核心主張只有一句:先學會交付,再擴充工具。手冊裡的數字都標明是教學假設或練習起點,不是市場行情,我引用時也照標。
基本功一:看懂整條流程
影片製作大致分四段:前期決定給誰看、要讓對方懂什麼;製作取得畫面與聲音;後期排順序、混音、上字幕;交付處理格式、修改與使用權。
AI 模型只是「製作」這一段裡的一種素材來源,跟實拍、錄音、螢幕錄影是平行的選項。拆細一點,就是下面這八站。
每一站進下一站之前,都可以先問自己一個問題。點開每一站看看:
第 1 站:需求確認
進下一站前先問:雙方對「要說什麼、交什麼」理解一樣嗎?
第 2 站:腳本
進下一站前先問:有沒有寫進查證不了的效果、價格或功能?
第 3 站:分鏡
進下一站前先問:每一鏡都帶來新的資訊或情緒嗎?
第 4 站:動態分鏡
進下一站前先問:不靠漂亮畫面,故事已經成立了嗎?
第 5 站:關鍵畫面
進下一站前先問:這張圖足以代表成片的樣子嗎?
第 6 站:素材製作
進下一站前先問:每段素材都有可以剪的頭尾餘量嗎?
第 7 站:後製
進下一站前先問:訊息清楚,沒有讓人分心的錯誤嗎?
第 8 站:驗收交付
進下一站前先問:規格、觀看品質與使用權都過關了嗎?
最常被跳過的是動態分鏡(Animatic):把分鏡圖放進時間軸,配上自己念的暫時旁白,先看節奏。它很粗糙,卻能在花第一筆生成費之前,告訴你故事有沒有成立、旁白有沒有超時。
手冊有個提醒很實用:先用手機把稿子完整念一遍,量出實際長度,再替畫面留辨識時間。不要把 55 秒的稿硬塞進 30 秒,最後靠快到看不完的字幕補救。
我自己的彩排也是同樣的骨架:關鍵畫面先逐張核准,估好價、確認付費後才生成,之後逐鏡檢查、剪接、配聲音,最後親手上傳。完整經過在〈AI 影片不是輸入一句話就好〉。
基本功二:把核准點當成「改動價目表」
很多人以為核准就是「之後不能改」。比較準確的說法是:核准後還是能改,但你知道改這一刀會牽動哪幾步。
- 改一個字幕錯字:通常只動到後製。
- 旁白的「今天」改成「下週」:可能牽動嘴型和片長。
- 角色從短髮改成長髮:所有關鍵畫面和生成片段可能都要重做。
所以我的流程裡,已核准的檔案不覆寫:要改就出新版本,重新送審。多一道手續,換來每一次修改都看得見代價。
另一個習慣是回饋的寫法。「再有質感一點」這種意見,製作端沒辦法執行。可執行的回饋至少要有三樣:
- 時間點:哪一秒到哪一秒。
- 觀察:看到了什麼問題。
- 期望:改成什麼樣子才算對。
再加上「嚴重度」(擋住交件、應該修、口味問題),以及「這是不是超出原本核准的範圍」。修正瑕疵和變更範圍是兩回事,後者要重新估時間與費用。多人給意見時,先整理成同一輪再交出去。
下面三則回饋是示意,非實例。哪一則,製作端拿到就能直接動手改?
- A 再有質感一點:沒有時間點,也沒說「質感」指什麼、要改成什麼樣子。
- C 節奏再好一點:同樣沒有時間點和具體期望。改寫時照「哪一秒到哪一秒+看到什麼問題+改成什麼樣子」補齊。
看答案
基本功三:分鏡每格回答七件事
先對齊兩個詞:鏡頭是剪輯裡一段連續的視角;拍攝次是同一個鏡頭的不同版本,AI 每重新生成一次就是一個新的拍攝次。
還有一個常被忽略的事實:素材長度不等於使用長度。10 秒的生成素材可能只有 3 秒能用;成片要用 3 秒,也可能要生成更長,才有自然的頭尾與剪接餘量。
手冊對分鏡的要求我很認同,每一格至少回答七件事:
- 第幾鏡
- 在成片裡用幾秒
- 景別與鏡位(離多遠、從哪個角度)
- 主體在做什麼
- 攝影機在做什麼
- 觀眾聽到什麼
- 這一鏡的用途(少了它,故事會缺什麼)
用 AI 生成時,我會再加四欄:參考圖、人物或商品的一致性規則、製作方式(生成、實拍還是後製合成)、驗收條件(看到什麼才算通過)。最好再加一欄備案:生不出來時改用什麼拍法。
示意寫法如下(非實際委託):
- 第 3 鏡,成片用 4 秒;中近景,胸口以上,平視
- 她放下手機,抬眼看向畫面右側;攝影機固定
- 聲音:環境雨聲,手機落桌的輕響;用途:讓觀眾知道她做了決定
- 製作方式:用已核准的關鍵畫面當第一格,讓它動起來
- 驗收:臉與衣著和核准圖一致、抬眼動作完整、全程只有她一人
- 備案:動作不自然,就拆成「放下手機」與「抬眼」兩鏡
最大的好處是:驗收條件在生成之前就寫好了。看片時逐條對,而不是看完才說「好像還可以」。
很多人喜歡讓 AI 一次生一張 3×3 九宮格分鏡。它適合快速檢查景別是否單調,但有三個陷阱:九格圖不是九支影片,不能整張丟給影片模型;切開後每格解析度很低,要重做單鏡參考;九格一起生會互相污染,服裝和人數可能悄悄改變。
生成前還有三個判斷:
- 先選做法,再選模型:商品示範、精確動作,實拍加後製往往比較穩。
- 估一下這一鏡有多難:人數、同時發生的動作、遮擋與接觸、攝影機運動、物件精確度,任何一項增加,風險就上升。整支片的核心是一個很難的鏡頭,就先試那一鏡。
- 每鏡設重試上限:我的規則是每鏡最多兩次,第二次之前一定要先寫出失敗原因、改輸入,不原封不動再送一次。
基本功四:交付規格先寫下來
這是非影視背景最容易輕忽、也最常在最後一刻出包的地方。手冊列了一組練習用的起點(不是所有平台的規定):
- 直式 1080×1920、9:16
- MP4 檔、H.264 影像編碼
- 幀率和核准的時間軸一致,24、25、30、29.97 不能混稱
- 聲音 AAC、48 kHz
- 附件:封面、字幕檔、核准版與版本說明
我自己上傳 YouTube 的 30 秒彩排預告,是橫式 1920×1080、24 fps,響度約 -16 LUFS(衡量整支片平均聽起來多大聲的單位)。
字幕有兩種:燒進畫面的,和另外交的字幕檔(常見 SRT 格式),後者可以讓平台處理,也方便自動翻譯。對方要「字幕檔」,只交一支有字幕的影片是不夠的;必要時也準備一份無字版。
安全區沒有通用答案:直式影片在不同平台,標題、帳號、按鈕會蓋住不同位置,而且介面會改版。重要的人物、商品和字幕先留空間,再用當下的平台預覽確認。
匯出之後,跑一遍這五項:
- 打開輸出檔,確認不是黑畫面、空白或舊版。
- 從頭聽到尾,沒有漏音、跳音或尾句被切掉。
- 用手機看字幕與重點畫面。
- 對照最後核准的稿子,再核一次價格、日期與品牌名。
- 片尾沒有範本浮水印、未授權標誌或不該露出的私人資料。
我自己就在第 2 項被擋過:幾段影片接起來之後,聲音比畫面長了 60 毫秒,超過上傳檢查的容忍值。解法是重新封裝、讓聲音跟著畫面結束,而不是把已核准的畫面重新壓一次。很小的數字,卻足以讓整包交件卡住。
你可以這樣開始
- 下一支片開工前,先寫一頁需求單:給誰看、哪個平台、片長、要交幾個版本。
- 生成前先做動態分鏡:分鏡圖加上自己用手機念的暫時旁白,確認節奏和長度。
- 每一格分鏡照七件事填寫,再加上參考圖和驗收條件。
- 給回饋或收回饋時,一律寫成「時間點+觀察+期望」。
- 把交付規格和匯出後五項檢查存成清單,每次交件前逐條打勾。


