第二幕|LLMAI 入門:四個關鍵詞

LLM:會說話的 AI 誕生了

上一幕,機器開始從資料裡自己學,但 AlphaGo 只會下棋這一件事。這一幕,機器開始學「語言」,而語言幾乎能拿來做所有事。

這一幕要回答

ChatGPT 為什麼好像什麼都懂?它其實在做什麼?又有哪些地方要小心?

AI 生成插畫:書本和網頁碎片圍著一顆藍色光球旋轉,光球冒出第一個對話框;戴白色笑臉大帽的老師攤手介紹,史旺姬驚訝地看著
先猜猜看

你在聊天視窗打一個問題,收到一段很完整的回答。你覺得 ChatGPT 是在做哪一件事?

看答案
B,它比較像是在「接話」。
LLM 的成長史

從一篇論文到全世界都在用,只花了 5 年

LLM 不是突然有一天就出現的。它走了兩條路:一條是規模越做越大(讀更多資料、加更多參數),另一條是教它當助理,讓它更會照人的要求做事。兩條路一起往前,某一天它突然變得很好用。

  1. 2017

    📄 Transformer

    新的讀句子方法:每個字都能回頭看前文,又能用大量晶片一起訓練。GPT 的 T 就是它。

  2. 2019

    🙊 GPT-2

    寫的文章太像真的,OpenAI(後來做出 ChatGPT 的公司)一開始不敢完整公開。

  3. 2020

    📈 GPT-3

    1,750 億個參數(AI 腦中可調的小旋鈕);先在問題裡給它看幾個例子,它就學會新任務。

  4. 2022/11

    🚀 ChatGPT

    11 月 30 日上線,5 天就突破 100 萬名使用者。

  5. 2023/1

    🌏 1 億人

    推出約 2 個月,每月實際在用的人估計 1 億(TikTok 約 9 個月、Instagram 約 2 年半)。

研究期:越做越大爆紅期:教會它當助理之後

只記一句LLM 不是一夕爆紅:先把同一個方法越做越大,再「教它當助理」,某一天突然變得很好用。

「5 天破百萬」和「2 個月一億人」是不同時間、不同統計方式的數字,不要混成同一件事。出處:Vaswani et al. (2017) arXiv 1706.03762;Brown et al. (2020) arXiv 2005.14165;OpenAI (2019-02-14) GPT-2 公告;Sam Altman X 貼文 (2022-12-05);Reuters 引述 UBS (2023-02-01)。

先玩一個遊戲

你也是 LLM:看到前面,馬上猜得出下一個字

不用開任何工具。先在心裡把這四題接完,再一題一題打開答案;也可以想想別人會不會接得一樣。你剛剛做的事,就是 LLM 在做的事。

🌙床前明月_🙈 先在心裡說出來
揭曉
「光」。幾乎每個人都接得一樣。
🧋珍珠奶_🙈 先在心裡說出來
揭曉
「茶」。線索很明確,答案很集中。
🍜下班想吃_👀 想想別人會怎麼接
揭曉
沒有標準答案。拉麵、火鍋、滷肉飯……每個人接的都合理,但都不一樣。
🤔我昨天夢到_🤷 寫得出來嗎?
揭曉
你當然可以接出一句話,但你不知道我真正夢到了什麼。接得出來,不代表知道真相。

這個小遊戲要建立兩個感覺:

  1. 接得流暢,不代表知道真實發生了什麼。
  2. 給的背景越清楚,下一步的答案通常就越集中。

後面講幻覺和 Prompt,都會用到這兩個觀念。

AI 生成插畫:一排發光拼圖塊從藍色光球接出來,最後一格還空著;下方候選拼圖大小不一,戴白色笑臉大帽的老師指著最大的那塊,史旺姬拿著一塊正要放進空格
關鍵詞 1:LLM

LLM:讀過整個網路的「文字接龍高手」

上一題的答案:①「光」②「茶」③④ 沒有標準答案——線索越多,答案越集中。LLM 是 Large Language Model,大型語言模型:它從海量文字裡學習,預測下一小塊文字可能是什麼,再一塊一塊產生回答。

LLM = 文字接龍高手
LLM猜下一塊
光
一格=一塊 Token(示意);常見的詞會合成一塊(見下方 Token)照機率抽出下一塊:越可能,越常抽中
L

Large:大

參數從 GPT-2 的 15 億,到 GPT-3 的 1,750 億。資料和規模都很大。

L

Language:語言

核心是讀寫文字。現在也有能一起看圖、聽聲音的模型。

M

Model:模型

一大組訓練好的數字,叫參數,像混音台上的小旋鈕;訓練就是把旋鈕轉到最會接話的位置。它不是一張張人工寫好的答案卡。

適合交給它

寫、改、摘要、翻譯、發想點子、整理格式。

別把它當百科全書

重要數字、規定、法律判例,要自己對照出處。回答完整,不代表每一句都查過。

只記一句LLM 不是在「查答案」,是在「接話」:照機率一塊一塊(Token)抽出下一塊,機率越高越常被抽中。

出處:OpenAI (2019) GPT-2 分階段釋出;Brown et al. (2020) arXiv 2005.14165。

配角名詞・聽過就好

Token:AI 讀字的「拼圖塊」,也是計費的依據

切換看看:同一句話,人和 AI 看到的不一樣
今天天氣真好?
一句話在 AI 眼中=一排拼圖塊,它每次只猜最後那個「?」(切法是示意,實際依模型而定)

是什麼

AI 不是一個字一個字讀,而是把句子切成一塊塊拼圖。常見的詞是一塊,罕見的字可能被切成好幾塊。

也是計費的依據

像手機的通話秒數:你貼進去的字和 AI 回的字都算 Token,講越多、算越多。實際費用看工具和方案。

中文怎麼換算

GPT-3 時代每個中文字約 1.5 個;GPT-4o 平均只要 0.6 個:常見的兩三個字會合成一塊。

🍓

經典笑話

先自己數:strawberry 有幾個 r?

打開答案
3 個。AI 看到的是拼圖塊、不是字母,所以數字母常出錯。人覺得簡單的事,不代表 AI 一定不會錯。

只記一句Token 決定 AI 一次讀得了多少、要付多少錢。

出處:OpenAI Help Center〈What are tokens〉;markhuang.ai 中文 Token 實測。

LLM 怎麼回答你

四個步驟一直轉,轉出一整段回答

按「下一步」一步一步播放

1

切成 Token

今天天氣今天天氣

每塊換成一串數字,模型才算得動。

2

回頭看前文

今天天氣真_

找出誰跟誰有關 → 在說天氣。

3

猜下一塊

好熱冷

從認得的十幾萬塊裡挑;機率高的比較常抽中。

4

接上去

今天天氣真+好

新接上的直接加在後面,再回到第 2 步。

重點是第 4 步底下那條回頭箭頭:它不是把一張完整的答案卡一次抽出來,而是帶著剛多出來的內容,回到第 2 步繼續預測。

只記一句流暢的回答,是幾百次「猜下一個 Token」累積出來的。

出處:Vaswani et al. (2017) arXiv 1706.03762;OpenAI tiktoken(cl100k_base 約 10 萬、o200k_base 約 20 萬個 Token)。

步驟 3 放大看:LLM 的腦內小劇場

「今天天氣真_」:下一塊的機率

今天天氣真_

示意數字,不是實際模型輸出;此例每個候選剛好是一個字,「…」代表其他候選。

低溫・穩定高溫・多變

抽過的字:

  • 不是查表,是機率。每接一塊,都會算出一整排候選的機率,再像抽籤一樣抽出一塊。還記得「下班想吃_」嗎?答案本來就有好幾種。
  • 為什麼同一題每次答案不一樣?因為它是依機率「抽籤」。控制抽籤的設定叫 Temperature:溫度低,幾乎都選「好」,很穩定;溫度高,「棒」「差」也會被抽到,有創意也容易出錯。
  • 一般聊天 App 沒有溫度可以調。你能做的是在交辦時指定格式、給範例(第三幕會教),答案就會穩定很多。
  • 現在就試:在你常用的 AI 助理連問兩次「用一句話形容星期一」,兩次一樣嗎?

只記一句「機率最高」不等於「事實正確」。很常見、很順的句子,和有沒有查到正確資料,是兩件事。

Temperature 設定見 OpenAI 開發者文件。

那它怎麼學會這樣接?

從會接龍到會聽話:三段訓練

如果它只是在接龍,為什麼知道要回答我,還會照我的要求翻譯或整理?因為它被教過怎麼當助理——可以想成「先自學、再上課、再被批改」。點每一段看細節。

先自學:讀海量文字,練習猜下一塊

學到了語言和很多模式。但光會接下去寫,還不會當助理:你問一個問題,它可能只是把那段文字繼續寫下去。

學會:接龍(不一定回答你)

床前明月光
2022/3 InstructGPT:被教過,比長得大重要
13 億
🏅 被教過的小模型
勝過
1,750 億
GPT-3

真人比較後,更喜歡被教過的小模型(13 億個參數)。ChatGPT 也用了同一套方法。

後來……2024/9 推理模型(聽過就好)

回答前先打一段草稿,再作答,所以比較慢、也比較貴:想得越久,用的 Token 越多。

只記一句ChatGPT 會聊天,不只因為「大」,也因為被「教過怎麼當助理」。

出處:Ouyang et al. (2022) arXiv 2203.02155;Bai et al. (2022) Constitutional AI, arXiv 2212.08073;OpenAI〈Introducing ChatGPT〉;OpenAI o1 System Card (2024-09-12)。

別搞混

LLM 是引擎,ChatGPT、Gemini 是裝了引擎的車

三層分清楚:車、引擎、書
App(車)畫面・帳號・紀錄
🚗 ChatGPT
🚗 GeminiApp 與引擎同名
🚗 ClaudeClaude Code兩台車,裝同一顆引擎
裝進
LLM(引擎)讀懂、寫出文字
⚙️ GPTOpenAI 公司
⚙️ GeminiGoogle
⚙️ ClaudeAnthropic 公司
訓練
訓練資料(書)出廠前讀完
📚 書籍・網頁・程式碼

問「哪個 AI 比較好」時,先問清楚是在比引擎,還是在比整台車——就像比引擎馬力,和比車上有沒有導航、後車廂多大,不是同一件事。也因為引擎讀的書停在某一天,模型學過的知識和 App 能不能另外上網查新資料,要分開看。

分分看

這些名字,是車(App)還是引擎(模型)?

ChatGPT
GPT
Gemini
Claude Code

只記一句問「哪個 AI 比較好」時,先分清楚是在比車(App)還是比引擎(模型)。

使用 LLM 要知道

LLM 的三個脾氣,各有一個對策

點一下卡片,翻到背面看具體怎麼做。

1

幻覺:講得很順,不一定對

很有把握的回答……不一定對

它挑的是「最順」的字,不是「最對」的字,可能把不存在的內容講得很有把握。

對策:重要的事自己查證

點我看怎麼做 ↻

對策:重要的事自己查證

請它附來源,也可以明講「不確定就說不知道」;但最後還是要自己看原始資料。

再問一次「你確定嗎」不算查證。

再點一次翻回去

2

知識截止日

學過的? ?

像出國一年沒上網的人:不是沒知識,而是回來還以為最紅的是去年那首歌。最新規定、當天的資訊,它可能不知道。

對策:新資訊自己貼,或叫它先查

點我看怎麼做 ↻

對策:新資訊自己貼,或叫它先查

把最新資料貼給它;如果你用的工具能上網或查資料,請它先查再答。

再點一次翻回去

3

桌子有限

舊的被擠掉

桌子=AI 一次能讀進來的量(見下方 Context window)。再大(約 100 萬 Token)也會滿:舊的被擠掉、中段容易看漏。

對策:對話太長就開新的

點我看怎麼做 ↻

對策:對話太長就開新的

先請它整理重點,再換一張乾淨的桌子繼續。下一段就來玩這張桌子。

再點一次翻回去

只記一句三個脾氣,三個對策:查證、補新資訊、重開對話。

出處:Kalai et al. (2025) arXiv 2509.04664;Gemini 1.5 Pro 公告 (2024-02-15);Liu et al. (2023) arXiv 2307.03172;Cambridge Dictionary (2023-11)。

配角名詞・聽過就好

Context window:AI 的辦公桌,桌面就這麼大

你說的話、貼的檔案、它先前的回答、讀進來的手冊、工具查回來的資料,都要放到這張桌上,才能成為這一次回答的依據。而且模型本身不記得你說過什麼:是 App 每一輪都把整疊內容交給它重讀一次。

辦公桌模擬器:一直往桌上放東西,看看會發生什麼事

桌面使用量
你送出新問題

桌面是空的

LLM本身不記得你說過什麼
每一輪:整疊重讀 | 越長:越慢、越貴、越擠

管好桌面的四招
  1. 換主題就開新對話
  2. 聊久了:先請它摘要,再帶到新對話
  3. 長文件只貼相關的段落
  4. 常用的工作規則,寫成手冊(第五幕的 Skill)

桌上的東西:滿了,最舊的會被擠掉;就算沒滿,長內容的中段也容易被看漏。開新對話,桌子就清空(除非 App 另外開了「記憶」功能)。

你遇過嗎?聊到後來,它忘了「剛剛不是說要一頁以內」?與其一直在原地重複提醒,不如先整理桌面。要記的不是記憶容量的數字,而是:重要背景,要讓它在當次工作裡清楚看得到。

只記一句AI 本身不帶記憶,每次都重讀整張桌子。管好桌面,回答就穩。

出處:Liu et al. (2023) Lost in the Middle, arXiv 2307.03172。

小測驗 2/10:LLM 的桌子

你跟 AI 討論活動企劃聊了兩小時,它開始忘記你一開始說的「全文不超過 1 頁」。最好的做法是?

看答案
C,先摘要再開新對話。

自學計分:先選定再看解答;答錯的話,回到上面的「辦公桌」重看。

真實案例:2023 年美國紐約

律師用 ChatGPT 找判例,交出 6 個根本不存在的案子

情境重現(依法院文件改寫)

律師:幫我找航空公司乘客受傷求償的判例。
AI:可參考 Varghese v. China Southern Airlines 等案例……(看起來非常專業)
律師:這些案子是真的嗎?
AI:是的,這些案例確實存在,可以在法律資料庫查到。
⚖️ 後來呢?這場官司叫 Mata v. Avianca(真的案子),但律師交出去的 Varghese 等 6 個判例,全是 ChatGPT 編的。法官判兩位律師與事務所罰款 5,000 美元。

📌 注意:罰款是因為律師「沒查證就交出去」,被質疑後還堅持;不是因為用了 AI。

AI 生成插畫:藍色光球吐出一疊看起來很專業、邊緣卻正在碎掉的半透明文件;史旺姬拿放大鏡皺眉檢查,戴白色笑臉大帽的老師把一本真正的厚書推到她面前

最值得注意的是:律師不是完全沒有問。他追問了「這些案子是真的嗎?」,AI 仍然說是真的。AI 說「我確定」,不能替我們完成專業責任。

三個保護自己的方法
  1. 請它附出處,並自己點開確認——這一條最不能省。
  2. 跟它說「不確定就說不知道」,別為了湊出答案而猜。
  3. 讓它先查資料再回答(下一段:RAG)。

問另一個 AI,或再問同一個 AI 一次,都不能代替你自己看原文。

只記一句AI 說「我確定」不代表它是對的。越重要的事,越要自己查證。

出處:Mata v. Avianca, Inc., S.D.N.Y. (2023-06-22)。

配角名詞・聽過就好

RAG:讓 AI 從「閉卷考」變「開卷考」

閉卷考:只憑記憶

答案?
  • 截止日後的事不知道
  • 不懂你們公司的內部規章
  • 想不起來就亂編

像沒帶課本就上台報告。

開卷考:RAG=先查再答

你的問題
1R 檢索先到你們的文件裡找相關段落
2A 補充把段落夾進來,和問題一起交給 AI
3G 生成根據文件寫
答案附出處方便查證
開卷也可能翻錯頁:找錯段落,照樣會答錯。出處還是要點開看。

RAG 拆開是 Retrieval、Augmented、Generation,不用背英文,記成「找資料、補進去、再回答」就好。資料怎麼找?一種常見方式是把段落轉成代表意思的數字、找出意思相近的內容;也可以用關鍵字,或兩種合併。

RAG 能減少幻覺,但不保證每次都對。它附上出處,正是為了讓你方便核對,而不是看到引用就直接放心。

只記一句RAG=先查資料、再回答:減少幻覺,也讓 AI 能用上內部資料。

出處:Lewis et al. (2020) arXiv 2005.11401。

小測驗 3/10:AI 說「依據差旅辦法第 5 條」

同事問 AI 助理出差規定,它答得很順,還說「依據差旅辦法第 5 條」。下一步最該做什麼?

看答案
A,自己點開原文核對。

答錯的話,回到上面的「律師假判例」與「RAG」重看。

Takeaways

第二幕,帶走這幾句

第二幕到這裡:LLM 會生成回答,重要內容則要回到來源確認。知道要查證之後,下一幕回到我們這一端——工作到底該怎麼交代?

  • LLM 不是在查答案,是在接話:看著前文,一塊一塊(Token)猜出下一塊。
  • 「機率最高」不等於「事實正確」。回答很順、很有自信,也可能是錯的。
  • AI 本身不記得你說過什麼,每一輪都重讀整張桌子;聊太久就先摘要、再開新對話。
  • 問「你確定嗎」不算查證。重要的事,自己點開原始出處核對。
做自我檢核