- 6 天彩排交出 3 支片:我完成 4 模型比較、1 支 30 秒概念預告,以及卡通與擬真兩支 93.3 秒短片。
- 總花費是 US$64.11:成本大頭不在後製,而是長秒數鏡頭與重抽;每次多試一版都要先知道代價。
- 沒有一個模型包辦全片:首幀、首尾幀與參考圖各自控制不同問題,模型要依鏡頭需求選,不是看排行榜決定。
- 真正要設計的是製作流程:AI 影片從展示片走到可交件,需要能停下檢查、退回上一版、留下審核紀錄,也知道由誰核准。
我不是在做三支影片,我是在測一條產線
這次的起點,是一場現場才公布題目與角色造型的 AI 影像限時賽。
既然內容不能先做,我能準備的就只剩流程。更準確地說,我要知道:拿到一組陌生角色圖後,能不能在有限時間內完成分鏡、生成、審片、重抽、剪接、聲音、權利揭露與交件。
所以我沒有把目標設成「生出一支看起來很厲害的影片」。那種展示片一直都有人做。
我把目標設成比較無聊,但也比較接近真正交付的問題:
- 同一個鏡頭,該怎麼選模型?
- 哪些關卡可以自動跑,哪些一定要人看?
- 角色跑掉、比例拉長、參考圖被擋時,怎麼退回上一個安全狀態?
- 每次重抽前,誰知道這次要花多少錢?
- AI 助手或命令列工具(CLI)中途斷掉,下一個執行者能不能從製作紀錄檔(manifest)接手?
OpenRouter 的影片 API 本來就是非同步工作:先送出生成任務(job),再定期查詢狀態、取回結果與費用。[1] 這種介面很適合自動化,也很容易讓人誤以為「交給 AI 助手就完成了」。
問題是,生成完成只代表供應商回了檔案,不代表鏡頭能用。
我把每一個「不通過就先停下來」的檢查點,叫做人工檢查關卡(Gate)。這不是特別高深的技術名詞,白話就是:先確認前一步真的合格,再決定要不要花下一筆錢。
第一個教訓:排行榜只能幫你縮名單
08 月 23 日,我用同一張首幀、同一段輸入指令(prompt)、同樣 5 秒動作,跑了四個 OpenRouter 影片模型。
測試不是讓角色原地眨眼,而是衝刺、滑鏟穿過雷射、起身,攝影機還要後退跟拍。這種鏡頭會同時測到動作理解、物理連續性、角色保真與運鏡。
結果如下。金額是這次生成任務製作紀錄留下的實付,不是官網估價。
| 名次 | 模型 | 這次實付 | 結果 |
|---|---|---|---|
| 1 | Seedance 2.5 | US$1.165 | 動作與特技感成立,人物順利避開雷射 |
| 2 | Grok Imagine Video 1.5 | US$0.710 | 有趣,但角色跌倒,身體穿過雷射 |
| — | Seedance 2.0 | US$0.762 | 動作尚可,首幀角色卻漂成另一種卡通感 |
| — | Hailuo 3 | US$0.650 | 解析度最高,但人物只是蹲下,直接穿過雷射 |
我的原始評語是:「真的表現最好,有特技感且有慢動作的感覺,人物有順利躲過雷射,腳底火花的細節很讚。」
這裡面比較荒謬的地方是,Hailuo 給了 2K,卻沒有完成鏡頭最重要的動作。畫素比較多,不代表故事比較對。
Seedance 2.5 的官方模型頁把它定位在長篇敘事、多模態參考、影片延伸,以及首幀/首尾幀控制。[2] 這些能力確實符合我的用例,但最後選它,不是因為產品頁這樣寫,而是它通過了我的鏡頭。
排行榜與規格表負責縮小候選清單。最後的選型,還是要由自己的失敗模式決定。
首幀、首尾幀、參考圖,其實是三種不同控制
做 AI 影片時,「我有提供圖片」這句話太含糊了。
至少要分成三種模式:
- 首幀模式:這張圖就是影片第一格。適合從核准畫面開始動。
- 首尾幀模式:第一格與最後一格都指定。適合變身、轉場,或一定要抵達某個構圖的鏡頭。
- 參考圖驅動:圖片只定義角色長相、服裝、道具或風格,不保證成為第一格。
我先用 5 秒變身鏡驗首尾幀。第一抽就通過,實付 US$1.16523。也在這裡踩到一個 API 約束:首尾幀模式不能再送 aspect_ratio,畫面比例要跟著首幀走。
接著我才把難度拉高:只給人物參考圖,不給首幀,讓角色在 30 秒一鏡到底裡從雨夜台北穿過沙漠,再到太空站。
我先做了一個 4 秒低解析度的探針測試(probe),花了 US$0.415。身分與換景都成立後,才值得送出 30 秒正式生成。
這個短測試看起來像多花一筆錢。實際上,它是在避免把 US$6.94 的長鏡頭拿來猜 API 行為。
30 秒概念預告:模型一次過,後製還是做了三版
第一支彩排是 30 秒《BUNNY AWAKENS》。六個鏡頭裡,兩個英雄鏡交給 Seedance 2.5,短秒數支撐鏡交給 Grok 1.5。
五個新生成鏡頭第一抽全部完成,沒有重抽。這聽起來像順利結束了,其實只是另一種麻煩的開始。
後製做了三版:
- v1:畫面、音效與畫面上的介面框都先組起來。
- v2:拿掉紅色介面方框,放回 Grok 原聲。
- v3:重做稀疏的 dark-industrial 配樂與事件導向聲音,才通過人工審核。
我也跑了三首付費 AI 配樂,再做三版免費程序式音樂對照。最後我仍然選付費的 C 版,但我的結論不是「付費模型比較好」。
原話是:「Hermes 舊案效果好主要來自選曲、分層、cue 對時與人工挑選;付費模型不保證主觀品質更好。」
工具可以一次給你三首歌。它不會替你決定哪一個呼吸點該留白,也不會知道爆炸聲晚 6 格會讓整個鏡頭看起來像廉價特效。
成片已放上 YouTube:[3]
兩支 93 秒《REROLL》:真正會壞的是參考圖系統
08 月 27 日晚上,我把第二輪彩排拍板:同一個五段劇本,同時做卡通與擬真兩個版本。
到 08 月 28 日晚上,兩支 93.3 秒成片都完成並上傳。從需求問答、角色參考、14 張分鏡、付費生成、五輪審核、剪接到 YouTube 上傳包,大約 22 小時。
卡通版:[4]
擬真版:[5]
REROLL 卡通版|93.3 秒
REROLL 擬真版|93.3 秒
這一輪讓我看到三種很具體的失敗。
1. 寫實人物參考圖會被供應商擋
Seedance 會逐張檢查 input_references。同一角色的不同角度,有些通過,有些回 400;這類失敗不扣款,但會讓整段角色配置失效。
我最後讓工具支援 --drop-indexes:略過被擋圖片,並自動重編輸入指令裡的 @Image N 圖片編號與用途。這比人工刪圖片後再手改十二個索引可靠。
現場如果拿到寫實角色,第一件事不該是送 30 秒重點鏡頭,而是先用 480p、4 秒短測試,看參考圖到底能不能進模型。
2. 不同風格的參考圖不能混著補
擬真版最後一段缺了一個角色的可用寫實參考。我曾經拿卡通 sheet 補身分。
身分是回來了,整段卻被帶成動畫。
這個失敗很有用。它證明參考圖不是資料庫欄位,模型也不會只讀你希望它讀的部分。你放進去的每張圖,都可能同時影響長相、材質、比例與整體畫風。
最後我寧可把五人減成四人,也沒有再把兩種風格硬混在一起。
3. 一個形容詞也會把比例拉壞
我在多人鏡頭裡要求角色 tall,結果模型把所有人拉到約 8.5 頭身,看起來像被垂直縮放過。
後來我把指令改成約 7.5 頭身、自然比例、不拉伸,再明講誰比誰高半個頭,畫面才收回來。
這是 AI 生成常見的問題:人覺得是語意,模型常把它當畫面最佳化方向。形容詞沒有尺度,就會用你最不想看到的方式被放大。
US$64.11 買到的不是成片秒數,是失敗資訊
這次 OpenRouter 實付如下:
| 項目 | 實付 |
|---|---|
| 冒煙測試與四模型比較 | US$3.44 |
| 30 秒概念預告、首尾幀驗證與三首配樂 | US$4.65 |
| REROLL 參考模式短測試 | US$0.42 |
| REROLL 卡通版 7 次生成 | US$27.80 |
| REROLL 擬真版 7 次生成 | US$27.80 |
| 總計 | US$64.11 |
後製、剪接、字卡、混音、品質檢查與 YouTube 上傳包都在本機完成,因此沒有額外 API 現金成本。圖像使用既有 ChatGPT 訂閱額度,我也沒有把它假裝成零成本,只是沒有再分攤進這次 OpenRouter 帳本。
兩支 90 秒版本都在最後一段用到第三次生成。原本每鏡最多重抽兩次;第三次必須由我明示放行,並在成本與生成帳本(ledger)留下原因。
這種紀律不酷,但很有用。沒有它,AI 助手最容易做的事不是偷懶,而是很勤勞地幫你把錯誤多生五次。
審片看板最重要的功能,是不讓 AI 代替我說「可以」
整場彩排留下 10 份正式審核紀錄,格式是方便程式接手的 JSON。
我做的 Dashboard(審片看板)只負責呈現:關鍵幀、鏡頭、版本差異、成本與待確認項目。需要我用眼睛判斷的地方,才放在畫面上。其他填寫與狀態更新走命令列工具。
AI 助手可以提出草案,不能替我設定:
- 權利已清楚
- 預算已核准
- 鏡頭已通過
- 成片可以上傳
看板留下的審核紀錄檔才是唯一權威。AI 助手讀到核准,流程才往下走。
這跟我先前寫的 AI 權限與控制架構是同一件事,只是這次不是在談抽象設計,而是真的有影片、有帳單,也真的會在半夜把不該花的錢花掉。
另外,每張圖與每支影片旁都有製作紀錄檔:模型、輸入指令、生成任務編號、實付、檔案指紋、品質狀態與日期。狀態另有機器讀的 case-status.json、人讀的 STATUS.md,以及讓下一個 AI 助手接手的 HANDOFF.md。
任何一個 AI 工具中途中斷都不可怕。沒有接手點,才可怕。
權利與公開邊界:做得到,不等於什麼都能拿去用
這三支影片都是彩排、非參賽作品,也不是商業廣告。
角色來自我持有的 CloneX。含第三方藝術家特徵的角色只作非商業展示,不會放進正式參賽作品。YouTube 說明欄也已揭露畫面與聲音使用生成式 AI,以及作品與 RTFKT、Nike、主辦單位之間沒有贊助關係。
權利檢查目前不是「全部綠燈」:Grok output 已依相關條款查核;Seedance 透過聚合器使用時,模型條款對終端使用者的約束仍有未確認處。OpenRouter 本身也要求使用者遵守適用法律與上游條款。[6]
所以我不會把 YouTube 的自動 Checks 寫成法律清權,也不會因為 API 成功回傳,就假設輸出可以拿去做任何商業用途。
技術能不能做、平台讓不讓你上傳、法律上能不能使用,是三個不同的檢查關卡。
如果明天進場,我只帶這條最小產線
彩排完之後,我不會把所有工具都帶進比賽現場。工具越多,不一定越安全。
我會保留六件事:
- 先做 4 秒短測試:測角色參考與最難轉場,不用 30 秒鏡頭猜模型。
- 分鏡先核准並凍結:需要時可直接退回首幀模式,不從空白指令重來。
- 每段只用同一風格參考:缺角色就減少人數,不混用卡通與擬真人物參考圖。
- 生成前先估價:每鏡最多兩次,第三次必須人工核准。
- 逐鏡製作紀錄+單一審核紀錄:中斷後能接手,也知道哪一版才算通過。
- 最後一小時只做交件:規格、音畫長度、揭露、檔名與封裝,不再重做創意。
我現在比較不在意哪個模型能不能一次生成 30 秒。
我更在意的是,當第 18 秒的角色突然變成另一個人時,整條產線知不知道該停在哪裡、要退回哪一格,以及再試一次會花多少錢。
那才是 AI 影片從展示片走向正式交付的分界。


