用 AI 做影片,最常聽到的抱怨是:角色每一顆鏡頭都長得不太一樣。第一顆是她,第三顆好像是她的表妹,到了最後一顆,配件還換邊了。

我一開始也以為多塞幾張參考圖就好。後來發現問題不在圖不夠多,而是沒分清楚:這張圖要它管什麼、不准它管什麼。

30 秒結論
  • 「一致」其實是兩件事:角色是誰只認官方原圖,衍生圖再好看也只能管風格。
  • 先核准兩張圖再量產:一張角色定裝圖、一張風格定調圖,改了就重審。
  • 參考圖保得住長相,保不住構圖:要精確的人數與站位,就用首幀。
  • 漂移要排成一整排看:空間複雜的鏡頭,先用簡單的 3D 方塊排練站位與運鏡。

以下的例子,都來自我用自己持有的 CloneX 角色做的彩排,屬於非參賽、非商業的練習。

做法一:分清「是誰」和「長什麼樣」

寫提示詞之前,我會先替每個角色寫兩張清單:

  • 不能變的身分特徵:臉型、眼睛、髮型、膚質或材質、招牌配件、身形與頭身比。整個系列都要一樣。
  • 可以變的美術控制:服裝變體、光線、媒材、色調、場景、姿勢、鏡頭、情緒。每張可以不同。

參考圖也分兩級。官方原圖管身分,判斷「像不像」只看它。AI 生成或改繪的衍生圖只能管色調、光影與氣氛,就算它比官方圖好看,也不能拿來證明「這是同一個人」。

角色一致性分兩件事:身分特徵不能變、只認官方原圖;服裝、光線、色調等風格可以每張不同。拿衍生圖當身分參考,每傳一手走樣一點,最後變成另一個人。
圖 1:身分與風格分開管,衍生圖永遠不當身分證據。 點圖放大

這條規則擋的是「漂移會累積」。拿一張已經有點走樣的衍生圖當下一張的參考,再傳兩手,角色就變成另一個人了。兩者衝突時,以官方原圖為準,不取平均,也不挑最新那張。

還有一個小陷阱:背影可以證明髮型和身形,不能證明臉。

先考考自己:下面六個特徵,各屬於「不能變的身分」還是「可以變的風格」?想好再翻牌。

1

髮型

這是身分,還是風格?

點我看答案 ↻

身分:不能變

整個系列都要一樣,判斷只看官方原圖。

再點一次翻回去

2

光線

這是身分,還是風格?

點我看答案 ↻

風格:可以變

每張可以不同,衍生圖也能拿來定光線。

再點一次翻回去

3

招牌配件

這是身分,還是風格?

點我看答案 ↻

身分:不能變

正面看得到的別針,換到背面角度也不能消失。

再點一次翻回去

4

色調

這是身分,還是風格?

點我看答案 ↻

風格:可以變

衍生圖能管的,就是色調、光影與氣氛這一類。

再點一次翻回去

5

頭身比

這是身分,還是風格?

點我看答案 ↻

身分:不能變

身形與頭身比走樣,整個人看起來就不一樣了。

再點一次翻回去

6

姿勢

這是身分,還是風格?

點我看答案 ↻

風格:可以變

每張可以不同。但別拿上一顆鏡頭的畫面當身分參考,姿勢會被整組吸過去。

再點一次翻回去

做法二:先核准兩張圖,再開始量產

量產之前先過兩關,就像拍片前的定裝:

  1. 角色定裝圖:全身正面加臉部近照,中性背景、沒有文字。檢查長相、服裝、手腳、年齡感。
  2. 風格定調圖:一張夠複雜的完整場景,證明角色放進場景後沒走樣,色調和光線也能重複。

核准綁版本。之後臉、髮型、服裝或固定道具有任何改動,舊的核准就失效,存成新版本重審。

量產前的兩關:角色定裝圖(全身正面加臉部近照)、風格定調圖(一張完整場景),核准並綁定版本後才量產、先做三張試點;臉、髮型、服裝或固定道具一改,舊核准就失效,要重審。
圖 2:先過角色定裝圖、風格定調圖兩關,核准綁定版本才量產;外觀一改就回到起點。 點圖放大

我實際遇到的是:做擬真版時,第一次直接拿官方 CG 圖改,結果角色變成「瓷娃娃」。後來改成用文字描述一位真人演員來生成,參考圖只拿來對配件,才通過。順序也固定下來:先生成正面臉、經我核准,其他角度都拿這張核准臉當基準。

量產時,我先做三張試點,分別測單人臉部、雙人互動、三人或場景連續,沒問題才放量。第一次正式審圖,我一次看了 54 張,49 張直接通過。

能用一張核准參考圖,就不要用五張。每多一張參考,就多一個讓不該進來的東西滲進來的機會。

同一劇本的卡通版與擬真版短片,在同一段沙漠轉場的實際成片影格比較
實際成片:同一個劇本、同一組角色,卡通與擬真兩種風格各自鎖住長相。兩支都是彩排練習,非參賽、非商業。

做法三:知道參考圖能做什麼、不能做什麼

「參考圖模式」是只給模型角色或風格的參考圖,不指定影片第一格,讓模型自己決定構圖和動作。要很快出片時,這是最實際的路。

但它有極限。我用來串接影片模型的平台 OpenRouter,官方教學寫得很直接:參考圖用來引導主體、身分或風格,不是精確的畫面錨點;要精確控制第一格或最後一格,要改用首幀或首尾幀。[1]

我 2026 年 8 月用 Seedance 2.5 實測的感受是:

  • 做得到:這個人是誰、穿什麼、什麼質感。一支 30 秒一鏡到底,從雨夜台北到沙漠再到太空站,卡通、擬真兩版的角色都在三個世界維持同一人。
  • 做不到:精確的構圖、人數、站位與文字。背景招牌會生出亂碼字,要明講「所有招牌、海報、螢幕都是空白」;人數也要寫成精確數字。
  • 越長越容易漂:一支有首幀撐著的 5 秒鏡頭,中段的無人機還是從一台變成兩台,最後只剪前段。ByteDance 自己的公告也承認,多主體互動的穩定性仍要改進。[2]

兩種模式怎麼選:

  • 首幀模式最能鎖住人數、順序與構圖,但也會把首幀的缺點一起鎖住。
  • 參考圖模式靠角色圖保住長相,換來的是放棄逐格控制。
依最在意的事選路:精確構圖與人數用首幀模式,但首幀缺點也會被鎖住;很快保住長相用參考圖模式,但放棄逐格控制;空間站位複雜,先用白模排練。
圖 3:三個路標:在意構圖人數走首幀、在意快速保住長相走參考圖、空間複雜先白模排練。 點圖放大

另一個常見錯誤:不要把上一顆鏡頭生成的畫面,直接當下一顆的身分參考。它會像磁鐵一樣,把姿勢、鏡位整組吸過去。跨鏡頭的一致,應該來自同一組官方原圖和同一段固定描述。

做法四:排成一整排,才看得到漂移

漂移最麻煩的地方是:每一張單看都沒問題,排在一起才發現不一樣。

所以我會把整個系列用相同縮放、相同裁切排成一張對照表,掃臉寬、眼距、髮量、頭身比、配件在左還是右。各自縮放過的截圖不能當證據,因為比例變化正好會被藏起來。

五張同比例、同裁切的示意角色剪影排成一排,用頭頂、眼睛高度、配件位置三條對齊線掃過,第四張的金色別針從左邊換到右邊。
圖 4:同比例排成一排(示意剪影),用對齊線一掃,第四張的別針換邊就跑出來了。 點圖放大

兩個特別容易出事的地方:

  • 配件:正面看得到的金色別針,到了背面角度卻消失,就是連戲錯誤。
  • 表情:大笑、瞇眼的時候,最容易把長相擠壞。

要拿來生影片的第一格畫面,姿勢要真的靜止,不能有動態模糊或甩手殘影,因為影片會把殘影放大成多出來的手腳。付費生成前,放大檢查臉、雙手、雙腳;修圖是整條流程裡最便宜的修正點。

發現漂移時,不是只改最後一張,而是:

  1. 先停下後面的生成;
  2. 打開當初核准的那一版,當唯一標準;
  3. 每張受影響的圖做「左邊核准版、右邊目前版」的對照;
  4. 每張只給一個結論:重生、局部修補、通過,或無法判斷;
  5. 失敗的版本保留,不刪、不覆蓋。

換你找找看。以下是示意,非實例:同一個角色,左邊是當初核准的那一版,右邊是後來生成的一張。哪裡走樣了?

核准版(示意)

齊肩短髮、齊瀏海
左胸一枚金色別針
約 6 頭身
微笑

目前版(示意)

齊肩短髮、齊瀏海
右胸一枚金色別針
約 7 頭身
大笑、瞇眼

點開看哪裡走樣
走樣的有兩處:別針從左胸換到右胸(配件連戲錯誤),頭身比從 6 變 7(身分特徵)。表情從微笑變大笑屬於可以變的情緒,但大笑、瞇眼最容易把長相擠壞,臉要再對一次。下一步照上面五步:先停下後面的生成,拿核准版當唯一標準逐張對照。

做法五:空間複雜的鏡頭,先用白模排練

有些鏡頭的問題不是長相,而是空間:多人站位會不會互相擋住、攝影機繞一圈能不能一直看到主角。這些用文字很難講清楚,送進影片模型又很貴。

這時可以先用 Blender(免費開源的 3D 軟體)做白模預演:用沒有貼圖的簡單方塊,把場景大小、角色站位和攝影機路徑排出來,在花錢之前先確認這個畫面拍不拍得到。

順序大致是:先定這一鏡要交代什麼;再排空間與動線;再排攝影機路徑;最後輸出小尺寸的快速預覽檢查時長。修的時候先修站位與碰撞,再修構圖與時間。

白模預演四步:定任務、排空間與動線、排攝影機路徑、輸出快速預覽檢查時長;白模只管空間、時間和機位,角色長相與美術交給參考圖。
圖 5:白模預演四步。白模只管空間、時間和機位,角色長相交給參考圖。 點圖放大

交給影片模型時要寫清楚分工:外觀圖決定角色長相;白模影片只決定空間、時間和機位。白模裡的格線、箭頭與灰色材質,都不能被當成畫面風格。

我在 CloneX 舞蹈研究用過 Blender 輸出的動作參考:同一段舞步,彩色版和深度版都保留了主要動作順序。那是 Bunny(CloneX #15755)的非商業展示試片。

但我要誠實說:目前沒有任何實測證明白模能省多少錢、或提高多少成功率。白模也不是萬能,它可能保留原本模型的體形輪廓;要模型照做揮劍、抓握,白模本身就得真的包含這些動作。對一般固定鏡頭,我不會硬加這一步。

你可以這樣開始

  1. 替主角寫兩張清單:不能變的身分特徵、可以變的美術控制。
  2. 把參考圖分成兩疊:官方原圖管身分,其他只管風格。
  3. 量產前先做一張角色定裝圖和一張風格定調圖,核准後才放量。
  4. 每張參考圖在提示詞裡只給一個職責,例如「這張只管身分,不要複製姿勢與背景」。
  5. 每做完一段,用相同縮放排成一整排看一次;發現漂移就回到核准版對照修補。

我拍了十年制服人像。拍真人時,同一個模特兒就是同一個人;做 AI 影片時,「同一個人」要靠你先寫好的規則守住。


這個系列接著讀

參考資料