用 AI 做影片,最常聽到的抱怨是:角色每一顆鏡頭都長得不太一樣。第一顆是她,第三顆好像是她的表妹,到了最後一顆,配件還換邊了。
我一開始也以為多塞幾張參考圖就好。後來發現問題不在圖不夠多,而是沒分清楚:這張圖要它管什麼、不准它管什麼。
- 「一致」其實是兩件事:角色是誰只認官方原圖,衍生圖再好看也只能管風格。
- 先核准兩張圖再量產:一張角色定裝圖、一張風格定調圖,改了就重審。
- 參考圖保得住長相,保不住構圖:要精確的人數與站位,就用首幀。
- 漂移要排成一整排看:空間複雜的鏡頭,先用簡單的 3D 方塊排練站位與運鏡。
以下的例子,都來自我用自己持有的 CloneX 角色做的彩排,屬於非參賽、非商業的練習。
做法一:分清「是誰」和「長什麼樣」
寫提示詞之前,我會先替每個角色寫兩張清單:
- 不能變的身分特徵:臉型、眼睛、髮型、膚質或材質、招牌配件、身形與頭身比。整個系列都要一樣。
- 可以變的美術控制:服裝變體、光線、媒材、色調、場景、姿勢、鏡頭、情緒。每張可以不同。
參考圖也分兩級。官方原圖管身分,判斷「像不像」只看它。AI 生成或改繪的衍生圖只能管色調、光影與氣氛,就算它比官方圖好看,也不能拿來證明「這是同一個人」。
這條規則擋的是「漂移會累積」。拿一張已經有點走樣的衍生圖當下一張的參考,再傳兩手,角色就變成另一個人了。兩者衝突時,以官方原圖為準,不取平均,也不挑最新那張。
還有一個小陷阱:背影可以證明髮型和身形,不能證明臉。
先考考自己:下面六個特徵,各屬於「不能變的身分」還是「可以變的風格」?想好再翻牌。
髮型
這是身分,還是風格?
點我看答案 ↻
身分:不能變
整個系列都要一樣,判斷只看官方原圖。
再點一次翻回去
光線
這是身分,還是風格?
點我看答案 ↻
風格:可以變
每張可以不同,衍生圖也能拿來定光線。
再點一次翻回去
招牌配件
這是身分,還是風格?
點我看答案 ↻
身分:不能變
正面看得到的別針,換到背面角度也不能消失。
再點一次翻回去
色調
這是身分,還是風格?
點我看答案 ↻
風格:可以變
衍生圖能管的,就是色調、光影與氣氛這一類。
再點一次翻回去
頭身比
這是身分,還是風格?
點我看答案 ↻
身分:不能變
身形與頭身比走樣,整個人看起來就不一樣了。
再點一次翻回去
姿勢
這是身分,還是風格?
點我看答案 ↻
風格:可以變
每張可以不同。但別拿上一顆鏡頭的畫面當身分參考,姿勢會被整組吸過去。
再點一次翻回去
做法二:先核准兩張圖,再開始量產
量產之前先過兩關,就像拍片前的定裝:
- 角色定裝圖:全身正面加臉部近照,中性背景、沒有文字。檢查長相、服裝、手腳、年齡感。
- 風格定調圖:一張夠複雜的完整場景,證明角色放進場景後沒走樣,色調和光線也能重複。
核准綁版本。之後臉、髮型、服裝或固定道具有任何改動,舊的核准就失效,存成新版本重審。
我實際遇到的是:做擬真版時,第一次直接拿官方 CG 圖改,結果角色變成「瓷娃娃」。後來改成用文字描述一位真人演員來生成,參考圖只拿來對配件,才通過。順序也固定下來:先生成正面臉、經我核准,其他角度都拿這張核准臉當基準。
量產時,我先做三張試點,分別測單人臉部、雙人互動、三人或場景連續,沒問題才放量。第一次正式審圖,我一次看了 54 張,49 張直接通過。
能用一張核准參考圖,就不要用五張。每多一張參考,就多一個讓不該進來的東西滲進來的機會。
做法三:知道參考圖能做什麼、不能做什麼
「參考圖模式」是只給模型角色或風格的參考圖,不指定影片第一格,讓模型自己決定構圖和動作。要很快出片時,這是最實際的路。
但它有極限。我用來串接影片模型的平台 OpenRouter,官方教學寫得很直接:參考圖用來引導主體、身分或風格,不是精確的畫面錨點;要精確控制第一格或最後一格,要改用首幀或首尾幀。[1]
我 2026 年 8 月用 Seedance 2.5 實測的感受是:
- 做得到:這個人是誰、穿什麼、什麼質感。一支 30 秒一鏡到底,從雨夜台北到沙漠再到太空站,卡通、擬真兩版的角色都在三個世界維持同一人。
- 做不到:精確的構圖、人數、站位與文字。背景招牌會生出亂碼字,要明講「所有招牌、海報、螢幕都是空白」;人數也要寫成精確數字。
- 越長越容易漂:一支有首幀撐著的 5 秒鏡頭,中段的無人機還是從一台變成兩台,最後只剪前段。ByteDance 自己的公告也承認,多主體互動的穩定性仍要改進。[2]
兩種模式怎麼選:
- 首幀模式最能鎖住人數、順序與構圖,但也會把首幀的缺點一起鎖住。
- 參考圖模式靠角色圖保住長相,換來的是放棄逐格控制。
另一個常見錯誤:不要把上一顆鏡頭生成的畫面,直接當下一顆的身分參考。它會像磁鐵一樣,把姿勢、鏡位整組吸過去。跨鏡頭的一致,應該來自同一組官方原圖和同一段固定描述。
做法四:排成一整排,才看得到漂移
漂移最麻煩的地方是:每一張單看都沒問題,排在一起才發現不一樣。
所以我會把整個系列用相同縮放、相同裁切排成一張對照表,掃臉寬、眼距、髮量、頭身比、配件在左還是右。各自縮放過的截圖不能當證據,因為比例變化正好會被藏起來。
兩個特別容易出事的地方:
- 配件:正面看得到的金色別針,到了背面角度卻消失,就是連戲錯誤。
- 表情:大笑、瞇眼的時候,最容易把長相擠壞。
要拿來生影片的第一格畫面,姿勢要真的靜止,不能有動態模糊或甩手殘影,因為影片會把殘影放大成多出來的手腳。付費生成前,放大檢查臉、雙手、雙腳;修圖是整條流程裡最便宜的修正點。
發現漂移時,不是只改最後一張,而是:
- 先停下後面的生成;
- 打開當初核准的那一版,當唯一標準;
- 每張受影響的圖做「左邊核准版、右邊目前版」的對照;
- 每張只給一個結論:重生、局部修補、通過,或無法判斷;
- 失敗的版本保留,不刪、不覆蓋。
換你找找看。以下是示意,非實例:同一個角色,左邊是當初核准的那一版,右邊是後來生成的一張。哪裡走樣了?
核准版(示意)
齊肩短髮、齊瀏海
左胸一枚金色別針
約 6 頭身
微笑
目前版(示意)
齊肩短髮、齊瀏海
右胸一枚金色別針
約 7 頭身
大笑、瞇眼
點開看哪裡走樣
做法五:空間複雜的鏡頭,先用白模排練
有些鏡頭的問題不是長相,而是空間:多人站位會不會互相擋住、攝影機繞一圈能不能一直看到主角。這些用文字很難講清楚,送進影片模型又很貴。
這時可以先用 Blender(免費開源的 3D 軟體)做白模預演:用沒有貼圖的簡單方塊,把場景大小、角色站位和攝影機路徑排出來,在花錢之前先確認這個畫面拍不拍得到。
順序大致是:先定這一鏡要交代什麼;再排空間與動線;再排攝影機路徑;最後輸出小尺寸的快速預覽檢查時長。修的時候先修站位與碰撞,再修構圖與時間。
交給影片模型時要寫清楚分工:外觀圖決定角色長相;白模影片只決定空間、時間和機位。白模裡的格線、箭頭與灰色材質,都不能被當成畫面風格。
我在 CloneX 舞蹈研究用過 Blender 輸出的動作參考:同一段舞步,彩色版和深度版都保留了主要動作順序。那是 Bunny(CloneX #15755)的非商業展示試片。
但我要誠實說:目前沒有任何實測證明白模能省多少錢、或提高多少成功率。白模也不是萬能,它可能保留原本模型的體形輪廓;要模型照做揮劍、抓握,白模本身就得真的包含這些動作。對一般固定鏡頭,我不會硬加這一步。
你可以這樣開始
- 替主角寫兩張清單:不能變的身分特徵、可以變的美術控制。
- 把參考圖分成兩疊:官方原圖管身分,其他只管風格。
- 量產前先做一張角色定裝圖和一張風格定調圖,核准後才放量。
- 每張參考圖在提示詞裡只給一個職責,例如「這張只管身分,不要複製姿勢與背景」。
- 每做完一段,用相同縮放排成一整排看一次;發現漂移就回到核准版對照修補。
我拍了十年制服人像。拍真人時,同一個模特兒就是同一個人;做 AI 影片時,「同一個人」要靠你先寫好的規則守住。
這個系列接著讀
- AI 影片不是輸入一句話就好:6 天彩排 3 支成片:首幀、首尾幀、參考圖三種控制方式的入門。
- 我讓五隻 CloneX 跳 KPOP:參考影片可能才是瓶頸:Blender 動作參考的實際比較。
- 寫了一堆「電影感」關鍵字,AI 影片還是拍不出來?先把鏡頭語言分成三層:哪些寫進提示詞、哪些要拆鏡。
- AI 影片白話術語表:看不懂的詞先查這裡。
- AI 影片製作筆記:系列入口


