AI 影片製作筆記 AI Video Glossary

AI 影片白話術語表

運鏡、景別、生成、剪輯與看片驗收,共 117 個常見用語。第一次遇到的名詞,先看一句白話,再決定要不要深究。

8 個用語

景別

拍多近

同一個人的四種景別:建立鏡頭用寬景交代地點、中景腰部以上、中近景胸口以上、特寫最吃臉部一致性;攝影機離人越近,景別越緊。
出自〈鏡頭語言〉一文
大遠景extreme wide
人在畫面裡很小,環境才是主角,用來交代故事發生在什麼樣的世界。
全景wide/full shot
人物從頭到腳整個入鏡。
中景medium shot
大約拍到腰部以上。
特寫close-up
臉或身體局部佔滿畫面,常用在情緒鏡頭。
大特寫extreme close-up
只拍眼睛、嘴巴或物件的細節。
長焦壓縮telephoto compression
用 85–200mm 這類長焦鏡頭從遠處拍:背景像被拉近、前後距離感變扁,只有主角清楚、背景容易糊掉,看起來像從街對面偷偷觀察。
前景遮擋foreground occlusion
讓門框、樹葉、書架、玻璃這類模糊的近物擋住畫面一部分(常寫成佔 20–40%),製造「隔著東西看」的距離感與偶然感。
相機瑕疵語noise/highlight clipping/motion blur
在提示詞裡故意寫進雜訊顆粒、亮處過曝、輕微手震模糊這些真實相機才有的缺點,讓 AI 畫面不會乾淨得太假,更像實拍。
17 個用語

運鏡

攝影機怎麼動

推軌與變焦對照:推軌是攝影機整台往前移,前景跑得比背景快;變焦是攝影機不動、整張畫面均勻放大。
出自〈鏡頭語言〉一文
推軌dolly
攝影機整台往前推近或往後拉遠;不是變焦,是真的移動位置。
環繞arc
攝影機一邊繞著主體走、一邊持續對準它;走一小段弧線或繞滿一圈都算。
繞行一圈orbit
環繞當中繞滿 360 度的那一種,英文資料常另外叫它 orbit。
升降crane
攝影機垂直升起或降下,大場面常用。
橫搖/直搖pan/tilt
攝影機位置不動,鏡頭左右轉(左搖、右搖)或上下轉(上搖、下搖)。
變焦zoom
攝影機不動,用鏡頭把畫面拉近或拉遠(畫面放大縮小)。
手持handheld
刻意帶一點晃動,營造紀實、身歷其境的感覺。
跟拍tracking
攝影機跟著移動中的主角走,主角在畫面裡的位置大致不變。
甩鏡whip pan
快速轉動攝影機,畫面短暫模糊後重新對準目標;不能拿來遮掉觀眾本來該看清楚的關鍵一擊。
轉焦rack focus
讓清楚的焦點從一樣東西換到另一樣,例如從眼睛換到指尖;攝影機不一定有移動。
動作軸action axis
想像主角與對手之間有一條線;攝影機一直待在線的同一側,畫面上誰在左、誰在右才不會突然對調。
遮擋occlusion
近處的東西擋住後方東西的一部分;例如甲殼遮住刺進內側的劍刃,能幫觀眾看出誰在前、誰在後。
收勢follow-through
揮劍或撞擊之後,身體與武器順著重量和慣性把動作走完,能自然接到下一個動作,而不是停下來擺姿勢。
接續餘量handles
一段素材前後多留的可用動作,方便兩段接起來;不是把短動作放慢來湊秒數。
視差parallax
攝影機移動時,近處和遠處的東西在畫面上移動的幅度不同,看得出攝影機真的在空間裡移動。
低角度low angle
從下往上拍,人物顯得強大、有壓迫感。
慢動作slow motion
把時間放慢,強調關鍵瞬間;變身鏡頭幾乎都會用。
25 個用語

AI 生成

模型怎麼把畫面做出來

文字生影片t2v,text-to-video
只給文字描述,模型自己想像畫面。自由度高,但同一個角色每次生出來長相都會飄。
圖生影片i2v,image-to-video
給一張起始畫面,讓模型把它「動起來」。角色長相被那張圖鎖住,要固定角色時就走這條路。
首幀first frame
影片的第 1 格畫面;圖生影片就是拿它當起點。
尾幀last frame
影片的最後 1 格畫面。
首尾幀控制first/last frame control
同時指定影片的第一格和最後一格,中間的過程由模型自己補——頭尾都受控,最適合「從 A 狀態變成 B 狀態」的變身鏡。不是每個模型都支援,付費前也要先確認這個模式怎麼計價。
參考圖驅動reference-to-video
不給精確的起始畫面,只給角色或風格的參考圖,讓模型自己決定構圖和動作,只求「長得像參考圖」。適合「拿到角色圖就要馬上出片」的情況,代價是不能逐格控制畫面。
關鍵幀keyframe
一個鏡頭裡最重要的定格畫面,先做好給人核准,再拿去生成影片。
提示詞prompt
給模型的指令文字;「運動提示詞」專指描述畫面怎麼動的那一段。
試打/探針probe
正式生成前,先用最便宜的規格(低解析度、只生幾秒)打一小段,專門驗證最大的未知風險:會不會被內容審查擋下、參考圖有沒有被吃進去、對嘴行不行、畫面上的字會不會糊掉。不求好看,花小錢避免整段白做。
重抽roll/reroll
同一段影片重新生成一次(通常是結果不滿意時)。每一抽都要花錢,所以我會事先訂好每段的重抽上限(例如最多 2 次),超過要另外拍板。
隨機種子seed
交給模型的起始隨機數字;用同一個數字有助於比較,但不保證換一家服務或換個時間還會生出一樣的影片。
A/B 比較
其他條件盡量不動,只改一個主要條件,把結果並排比較;例如只給角色照,和同時給角色照加舞蹈影片。
多模型評比bake-off
同一個題目讓幾個模型各做一次,並排比較,挑出表現最好的。
影片用量單位token
部分服務商計算影片生成費用的單位,通常隨畫面大小、格數與參考影片長度增加;和 NFT 的編號無關。
生成紀錄manifest
每次生成的「身分證」:用了哪個模型、什麼提示詞、花了多少錢,以及用來確認檔案沒被換掉的檔案指紋。
內容審查content filter
模型服務商的自動審查;太嚴時會連正常題材都擋掉,例如曾遇過真人風格的起始畫面整張被拒收。
身分漂移identity drift
同一個角色在不同鏡頭裡長相走樣。要靠參考圖和固定的角色描述把它壓住。
風格定調圖style key
一張專門鎖住「畫面質感」(媒材、色調、光影)的圖;同一支片的每段提示詞開頭都逐字沿用同一段風格描述,並把這張圖當風格參考交給模型。
風格化參考圖styled sheet
先把官方角色圖改畫成目標風格(卡通或擬真)的人物參考圖。模型會保留「它看到的樣子」,拿 3D 原圖卻要它生真人一定會飄——所以先改畫再交給模型。
寫實photorealistic
像實拍真人電影的風格。多數模型排行榜測的就是這種。
風格化 3D 角色stylized 3D character
像動畫電影、遊戲 CG 或虛擬主播那樣一看就不是真人的美術風格;CloneX 就屬於這類。
第一視角POV,point of view
攝影機就是角色的眼睛:觀眾看到的就是角色看到的,例如低頭看自己的雙手。
預視pre-vis,previsualization
影片還沒拍、還沒生成之前,先用分鏡和關鍵幀「看」一遍成片大概長什麼樣子。
底噪room tone
空房間本身的聲音,例如冷氣、風扇、電流嗡嗡聲;換場景時換底噪,觀眾不用看字就知道換地方了。
聲音提示表cue sheet
逐秒列出「什麼時候該出現什麼聲音或台詞」的清單,剪接和混音照表執行。
31 個用語

影視/製作流程

從故事到成片

分鏡storyboard
把影片拆成一格格的連環畫草稿:每一鏡畫什麼、拍多長。
鏡頭表shot list
分鏡的表格版:列出每一鏡要怎麼取得(AI 生成、實拍或現成素材)。
節拍表beat sheet
故事的骨架清單:先發生什麼、再發生什麼,不管畫面細節。
故事主幹story spine
用主角的目標、阻礙、選擇與代價串起整支片的因果;少了其中一項,鏡頭再漂亮也容易只剩展示。
開頭抓點hook
開場很快丟給觀眾一個異常、衝突或承諾;可以先比較幾個開頭方案再選一個,並檢查前 3 秒、前 15 秒有沒有真的抓住人。
冷開場cold open
不鋪陳,第一秒就直接丟出最震撼的畫面。
動態分鏡animatic
把分鏡圖照時間串起來的「會動的草稿片」,用來確認節奏。
暫用聲音scratch audio
正式配樂與配音之前先放進去的台詞、節拍、音效或音樂草稿;在花錢生成之前先確認時間點對不對。
節奏定稿timing lock
每一鏡幾秒全部鎖定,之後只換畫面、不改時間。
英雄鏡頭hero shot
全片最貴、最好看、會拿去當封面的那幾顆鏡頭。
支撐鏡supporting shot
不是爆點的敘事鏡頭:交代日常、起因與收尾,讓英雄鏡頭有前因後果。用便宜的模型做、秒數短,要重抽時排在英雄鏡頭之後。
片尾收束tag
片尾的標題卡,加上最後一個讓人記住的畫面。
粗剪rough cut
第一版剪接:順序對了,但細節還沒修。
自然視效natural VFX
特效存在,但服從光線、材質、物理、表演和故事,不讓觀眾第一眼先看到「模型在炫技」。
變速慢放speed ramp/retime
剪輯時把已經生成的素材放慢拉長(例如 5 秒拉成 8 秒),不用重新生成、不花生成費。慢動作是變身鏡的標配,但原素材的格數不夠時會看起來卡卡的。
補幀frame interpolation
用軟體在兩格畫面之間算出中間格,讓慢放後的動作更順;屬於後製處理、不花生成費,但動作很快的地方可能出現殘影。
一鏡到底one-take
中途不剪接、一次生成整段(例如 30 秒內連換三個場景)。最能測出模型「換場景時人物會不會走樣」,但只要一處失敗就得整段重來,最花錢。
轉場transition
兩個場景之間的銜接方式,例如直接切、光牆掃過、慢慢疊過去;一鏡到底的轉場由模型自己畫,分段生成的轉場則靠剪接。
溶接/交叉淡化crossfade
前一段慢慢淡出、後一段同時淡入。如果聲音靠重疊縮短了時間,畫面也要照同一份時間表,不然聲音和畫面會對不上。
拉片shot breakdown
把一支成片倒推回逐鏡頭表:每鏡幾秒、拍多近、攝影機怎麼動、畫面是什麼;用來研究別人的節奏,或檢查自己剪的片有沒有照鏡頭表走。
切點cut point
兩個鏡頭交接的那一格。切點就是新鏡頭第一格出現的時間,相鄰兩個切點相減就是鏡頭長度。
場景偵測scene detection
讓軟體比較相鄰兩格畫面差多少,差超過門檻就當成換了一個鏡頭;門檻越低切得越碎,慢慢疊過去的轉場和暗畫面接暗畫面最容易漏掉。
聯繫表contact sheet
把很多張畫面縮小拼成一張大圖,一眼看完二十幾個鏡頭,不用一張張翻。
母題motif
在一支片裡反覆出現、讓觀眾一眼認出的畫面或元素(例如同一個版面的新聞播報畫面換主播、換語言);在快速剪接中給觀眾一個錨點,把分散的段落串起來。
直式插片pillarbox
在 16:9 橫的畫面裡放進 9:16 直的畫面,左右補黑邊;常用來表示「這是手機拍的目擊畫面」,也能改變節奏。
目擊片段found footage
假裝是路人手機或監視器拍到的畫面:會晃、是直的、看得到錄影介面;靠換視角增加真實感。
分貝dB
表示音量變化的單位;例如把某一句台詞加 4 分貝,只會讓那一句變大聲,不代表整支影片一起變大聲。
整體響度LUFS
衡量一整段聲音平均聽起來有多大聲的數值,用來比較整支片的音量。
未壓縮音訊PCM
保留完整聲音細節、沒有壓縮過的格式,方便混音與比對;最後交付影片時才再壓縮。
對嘴lip-sync
角色的嘴型和台詞聲音對得上。這是 AI 生成的高風險項目:先用一人一句短台詞、穩定的中景來測試。
分軌stem
把聲音拆成對白、環境音、音效、音樂各自獨立的一條,後製才能分別調大小;模型直接生出來的聲音是混好的一條,拆不開。
11 個用語

規格

畫面、檔案與角色設定

16:9
一般寬螢幕的畫面比例,YouTube 的標準比例。
2.39:1Scope
電影院的超寬比例,畫面上下更扁,更有「電影感」。
1080p
畫面解析度 1920×1080,也就是常說的 Full HD。
H.264
最通用的影片壓縮格式,幾乎在哪裡都能播。
每秒格數fps
每秒有幾格畫面;24 格是電影感的常見設定。
人聲閃避ducking
有人說話時背景音樂自動變小聲,講完再回來。
透明底alpha
圖片除了顏色,還多一層「透明度」資訊;去背後放到任何背景上都不會有色框。
棋盤格假透明
圖裡畫了灰白格子「看起來像」透明,其實是實心的顏色——真正的透明要有透明底資訊。
球關節doll joint
人偶手腳上的球形轉軸。生成模型很愛在膝蓋、手肘亂加這種關節;角色原本的設定沒有時,看片時一定要檢查。
三視圖turnaround
同一個角色正面、側面、背面的站姿圖並排,是做動畫或 3D 之前的標準人物設定格式。
人物設定圖character sheet
一張圖集齊臉部特寫、三視圖和配件細節,給之後的生成當「長相說明書」。
6 個用語

QA 判定

看片時怎麼打勾打叉

原子檢查項atomic claim
把一顆鏡頭「該做到的事」拆成一句只講一件事的短句(例如「環形光帶正好兩道」),能對著畫面直接打勾打叉;一句裡混了兩件事就拆成兩條。
成立/不成立/判定不了
單一檢查項的三種結論。「判定不了」只留給真的看不清楚的情況;「看得清楚、但結果中途變了」要判不成立。
證據不足
該看的東西沒入鏡、關鍵角度或時刻沒拍到——畫面很乾淨,但缺料。
證據不可靠
畫面糊掉、被擋住,或 AI 瑕疵剛好蓋在要看的位置——有畫面,但不能信。
倒放瑕疵
AI 影片的常見毛病:事件像倒帶,例如先撞爛才彈開、碎片自己組回原樣。時間順序錯了,每一格單看再漂亮也判不成立。但如果分鏡已經寫明這一鏡是刻意倒放(例如子彈飛回槍口),就不算瑕疵;沒寫明的一律判不成立。
觀眾視角左右viewer's left/right
檢查「左、右」一律以「你看螢幕」的左右為準,不是角色自己的左右手。
2 個用語

製作驗收

誰來判、照什麼判

硬條件hard constraint
一顆鏡頭「沒做到就算失敗」的少數幾條規格,例如「角色全程在畫面內」「第 3 秒前完成轉身」;每條只判通過、不通過或需要人再看,和「希望更好」的偏好分開寫。
獨立驗收independent review
檢查成片的人只拿規格、素材和成片來判,不看生成那一方自己寫的「我覺得成功了」,避免被自評牽著走。
13 個用語

剪輯與交付

剪完之後到交出去

畫面定版picture lock
剪輯順序和每個切點都不再更動的版本;之後才集中做精細字幕、混音和各種版本輸出。比「節奏定稿」更晚、也更嚴格。
燒錄字幕 vs 字幕檔SRT
燒錄字幕直接長在畫面裡、關不掉;字幕檔是另外附的文字檔(編號、出現與消失時間、文字),由平台或播放器顯示,可以開關、可以翻譯,但不保留字體和動畫。
無字版clean version
同一支片不含燒錄字幕和文字卡的版本,方便日後改字、換語言,或讓平台自動上字幕。
安全區safe zone
直式影片裡不會被平台標題、帳號名稱、按鈕擋住的範圍;每個平台不同、介面也會改,沒有通用的固定數字,要用當下平台的預覽確認。
正反打shot/reverse shot
兩個人對話時,輪流拍各自那一方再剪在一起;比讓模型在同一鏡生出兩個人互動更穩,也比較不會換臉。
道具狀態表
前製時把「誰坐哪一邊、杯子在哪、紙條摺著還是打開」依鏡號列成表,生成與剪輯時逐鏡對照,避免道具忽左忽右。
片尾卡end card
影片最後幾秒的品牌、名稱或行動呼籲畫面;交付前要確認沒有範本浮水印或不該露出的資料。
九格分鏡圖3×3 grid
一張圖排九個鏡頭的分鏡,只是審查用的工具,不能整張丟給影片模型;每一格都要各自重做成關鍵幀(整張等分後每格只剩原本的九分之一大小)。
鏡頭光暈lens flare
強光直射鏡頭時出現的光斑或光條;不能拿來掩蓋合成時影子方向錯誤的問題。
致命否決項
錯了就直接不能交的問題:未經授權使用真人的長相或聲音、商品規格錯、價格或日期等關鍵事實錯、私人資料外露、交付規格根本不符。其他項目分數再高也補不回來。
口型固定偏移/漸進漂移
固定偏移是整段聲音和嘴型都差同樣一段時間,調整時間軸就好;漸進漂移是前面對、後面越來越不對,多半是變速或轉檔造成。兩種都不必先花錢重新生成。
可用區段usable ranges
在生成紀錄裡標出「這段生成的影片,哪幾秒真的剪進成片」;沒標代表還沒看過,不等於 0 秒可用。這是計算「每一秒能用的畫面實際花多少錢」的依據。
結構化回饋
給修改意見時,寫清楚時間點、嚴重程度(擋住交付/應該修/個人口味)、希望變成什麼樣子,以及會不會動到已經核准的部分;讓「再有質感一點」變成能直接照做的修改。
4 個用語

可選影片增強

放大畫質與補細節

放大/超解析度upscale/upscaling
把影片的像素放大,例如把 720p 拉成 1080p 以符合交件規格;可以用免費的轉檔工具直接拉大,也可以用付費的放大模型。模型會「推測」補出細節,不保證補回真實內容,更修不好畫錯的手指或走樣的角色。
時序一致性temporal consistency
連續播放時,眼睛、線條、紋理和物件能穩穩延續,而不是每一格定格各自好看。
閃爍flicker
相鄰畫面的線條、紋理或亮暗不必要地跳動;判斷時要和原片、正常的動作以及剪接點對照。
幻覺細節
模型補出來的內容看起來很精細,卻沒辦法證明原本真的有。

這份術語表是我做 AI 影片時整理的白話對照,原本是給團隊裡沒有影視背景的夥伴看的。牽涉價格與特定模型能力的說法會隨時間改變,這裡刻意不寫數字。