LLM:會說話的 AI 誕生了
上一幕,機器開始從資料裡自己學,但 AlphaGo 只會下棋這一件事。這一幕,機器開始學「語言」,而語言幾乎能拿來做所有事。
ChatGPT 為什麼好像什麼都懂?它其實在做什麼?又有哪些地方要小心?
你在聊天視窗打一個問題,收到一段很完整的回答。你覺得 ChatGPT 是在做哪一件事?
看答案
從一篇論文到全世界都在用,只花了 5 年
LLM 不是突然有一天就出現的。它走了兩條路:一條是規模越做越大(讀更多資料、加更多參數),另一條是教它當助理,讓它更會照人的要求做事。兩條路一起往前,某一天它突然變得很好用。
- 2017
📄 Transformer
新的讀句子方法:每個字都能回頭看前文,又能用大量晶片一起訓練。GPT 的 T 就是它。
- 2019
🙊 GPT-2
寫的文章太像真的,OpenAI(後來做出 ChatGPT 的公司)一開始不敢完整公開。
- 2020
📈 GPT-3
1,750 億個參數(AI 腦中可調的小旋鈕);先在問題裡給它看幾個例子,它就學會新任務。
- 2022/11
🚀 ChatGPT
11 月 30 日上線,5 天就突破 100 萬名使用者。
- 2023/1
🌏 1 億人
推出約 2 個月,每月實際在用的人估計 1 億(TikTok 約 9 個月、Instagram 約 2 年半)。
只記一句LLM 不是一夕爆紅:先把同一個方法越做越大,再「教它當助理」,某一天突然變得很好用。
「5 天破百萬」和「2 個月一億人」是不同時間、不同統計方式的數字,不要混成同一件事。出處:Vaswani et al. (2017) arXiv 1706.03762;Brown et al. (2020) arXiv 2005.14165;OpenAI (2019-02-14) GPT-2 公告;Sam Altman X 貼文 (2022-12-05);Reuters 引述 UBS (2023-02-01)。
你也是 LLM:看到前面,馬上猜得出下一個字
不用開任何工具。先在心裡把這四題接完,再一題一題打開答案;也可以想想別人會不會接得一樣。你剛剛做的事,就是 LLM 在做的事。
揭曉
揭曉
揭曉
揭曉
這個小遊戲要建立兩個感覺:
- 接得流暢,不代表知道真實發生了什麼。
- 給的背景越清楚,下一步的答案通常就越集中。
後面講幻覺和 Prompt,都會用到這兩個觀念。
LLM:讀過整個網路的「文字接龍高手」
上一題的答案:①「光」②「茶」③④ 沒有標準答案——線索越多,答案越集中。LLM 是 Large Language Model,大型語言模型:它從海量文字裡學習,預測下一小塊文字可能是什麼,再一塊一塊產生回答。
Large:大
參數從 GPT-2 的 15 億,到 GPT-3 的 1,750 億。資料和規模都很大。
Language:語言
核心是讀寫文字。現在也有能一起看圖、聽聲音的模型。
Model:模型
一大組訓練好的數字,叫參數,像混音台上的小旋鈕;訓練就是把旋鈕轉到最會接話的位置。它不是一張張人工寫好的答案卡。
適合交給它
寫、改、摘要、翻譯、發想點子、整理格式。
別把它當百科全書
重要數字、規定、法律判例,要自己對照出處。回答完整,不代表每一句都查過。
只記一句LLM 不是在「查答案」,是在「接話」:照機率一塊一塊(Token)抽出下一塊,機率越高越常被抽中。
出處:OpenAI (2019) GPT-2 分階段釋出;Brown et al. (2020) arXiv 2005.14165。
Token:AI 讀字的「拼圖塊」,也是計費的依據
是什麼
AI 不是一個字一個字讀,而是把句子切成一塊塊拼圖。常見的詞是一塊,罕見的字可能被切成好幾塊。
也是計費的依據
像手機的通話秒數:你貼進去的字和 AI 回的字都算 Token,講越多、算越多。實際費用看工具和方案。
中文怎麼換算
GPT-3 時代每個中文字約 1.5 個;GPT-4o 平均只要 0.6 個:常見的兩三個字會合成一塊。
經典笑話
先自己數:strawberry 有幾個 r?
打開答案
只記一句Token 決定 AI 一次讀得了多少、要付多少錢。
出處:OpenAI Help Center〈What are tokens〉;markhuang.ai 中文 Token 實測。
四個步驟一直轉,轉出一整段回答
按「下一步」一步一步播放
切成 Token
每塊換成一串數字,模型才算得動。
回頭看前文
找出誰跟誰有關 → 在說天氣。
猜下一塊
從認得的十幾萬塊裡挑;機率高的比較常抽中。
接上去
新接上的直接加在後面,再回到第 2 步。
重點是第 4 步底下那條回頭箭頭:它不是把一張完整的答案卡一次抽出來,而是帶著剛多出來的內容,回到第 2 步繼續預測。
只記一句流暢的回答,是幾百次「猜下一個 Token」累積出來的。
出處:Vaswani et al. (2017) arXiv 1706.03762;OpenAI tiktoken(cl100k_base 約 10 萬、o200k_base 約 20 萬個 Token)。
「今天天氣真_」:下一塊的機率
今天天氣真_
示意數字,不是實際模型輸出;此例每個候選剛好是一個字,「…」代表其他候選。
抽過的字:
只記一句「機率最高」不等於「事實正確」。很常見、很順的句子,和有沒有查到正確資料,是兩件事。
Temperature 設定見 OpenAI 開發者文件。
從會接龍到會聽話:三段訓練
如果它只是在接龍,為什麼知道要回答我,還會照我的要求翻譯或整理?因為它被教過怎麼當助理——可以想成「先自學、再上課、再被批改」。點每一段看細節。
先自學:讀海量文字,練習猜下一塊
學到了語言和很多模式。但光會接下去寫,還不會當助理:你問一個問題,它可能只是把那段文字繼續寫下去。
學會:接龍(不一定回答你)
再上課:看大量「問題 → 好回答」的示範
像老師示範:你說「翻成英文」,它學會提供翻譯,而不是接著再出一個題目。
學會:問什麼,答什麼
再被批改:人類回饋
三個小步驟:① 請人替不同回答排名次;② 用排名訓練出會打分的「AI 裁判」;③ 模型照裁判的分數反覆練習(強化學習)。
學會:有禮貌、會拒絕危險要求
也有些回饋改由 AI 依一份原則清單來給。
真人比較後,更喜歡被教過的小模型(13 億個參數)。ChatGPT 也用了同一套方法。
後來……2024/9 推理模型(聽過就好)
回答前先打一段草稿,再作答,所以比較慢、也比較貴:想得越久,用的 Token 越多。
只記一句ChatGPT 會聊天,不只因為「大」,也因為被「教過怎麼當助理」。
出處:Ouyang et al. (2022) arXiv 2203.02155;Bai et al. (2022) Constitutional AI, arXiv 2212.08073;OpenAI〈Introducing ChatGPT〉;OpenAI o1 System Card (2024-09-12)。
LLM 是引擎,ChatGPT、Gemini 是裝了引擎的車
問「哪個 AI 比較好」時,先問清楚是在比引擎,還是在比整台車——就像比引擎馬力,和比車上有沒有導航、後車廂多大,不是同一件事。也因為引擎讀的書停在某一天,模型學過的知識和 App 能不能另外上網查新資料,要分開看。
只記一句問「哪個 AI 比較好」時,先分清楚是在比車(App)還是比引擎(模型)。
LLM 的三個脾氣,各有一個對策
點一下卡片,翻到背面看具體怎麼做。
幻覺:講得很順,不一定對
它挑的是「最順」的字,不是「最對」的字,可能把不存在的內容講得很有把握。
對策:重要的事自己查證
點我看怎麼做 ↻
對策:重要的事自己查證
請它附來源,也可以明講「不確定就說不知道」;但最後還是要自己看原始資料。
再問一次「你確定嗎」不算查證。
再點一次翻回去
知識截止日
像出國一年沒上網的人:不是沒知識,而是回來還以為最紅的是去年那首歌。最新規定、當天的資訊,它可能不知道。
對策:新資訊自己貼,或叫它先查
點我看怎麼做 ↻
對策:新資訊自己貼,或叫它先查
把最新資料貼給它;如果你用的工具能上網或查資料,請它先查再答。
再點一次翻回去
桌子有限
桌子=AI 一次能讀進來的量(見下方 Context window)。再大(約 100 萬 Token)也會滿:舊的被擠掉、中段容易看漏。
對策:對話太長就開新的
點我看怎麼做 ↻
對策:對話太長就開新的
先請它整理重點,再換一張乾淨的桌子繼續。下一段就來玩這張桌子。
再點一次翻回去
只記一句三個脾氣,三個對策:查證、補新資訊、重開對話。
出處:Kalai et al. (2025) arXiv 2509.04664;Gemini 1.5 Pro 公告 (2024-02-15);Liu et al. (2023) arXiv 2307.03172;Cambridge Dictionary (2023-11)。
Context window:AI 的辦公桌,桌面就這麼大
你說的話、貼的檔案、它先前的回答、讀進來的手冊、工具查回來的資料,都要放到這張桌上,才能成為這一次回答的依據。而且模型本身不記得你說過什麼:是 App 每一輪都把整疊內容交給它重讀一次。
辦公桌模擬器:一直往桌上放東西,看看會發生什麼事
桌面是空的
- 換主題就開新對話
- 聊久了:先請它摘要,再帶到新對話
- 長文件只貼相關的段落
- 常用的工作規則,寫成手冊(第五幕的 Skill)
桌上的東西:滿了,最舊的會被擠掉;就算沒滿,長內容的中段也容易被看漏。開新對話,桌子就清空(除非 App 另外開了「記憶」功能)。
你遇過嗎?聊到後來,它忘了「剛剛不是說要一頁以內」?與其一直在原地重複提醒,不如先整理桌面。要記的不是記憶容量的數字,而是:重要背景,要讓它在當次工作裡清楚看得到。
只記一句AI 本身不帶記憶,每次都重讀整張桌子。管好桌面,回答就穩。
出處:Liu et al. (2023) Lost in the Middle, arXiv 2307.03172。
你跟 AI 討論活動企劃聊了兩小時,它開始忘記你一開始說的「全文不超過 1 頁」。最好的做法是?
- B 再提醒一次:可能暫時有用,但對話還是很長、桌面還是很擠,像吃止痛藥。
- A 換模型:新模型的桌子一樣有大小限制。
- D 全部重貼:只會讓桌面更擠。資料不是堆越多越好。
實際可以這樣說:「請把目前確定的結論、還不能改的要求,整理成五點。」然後自己看一眼摘要有沒有漏掉你在意的限制,再帶到新對話。
看答案
自學計分:先選定再看解答;答錯的話,回到上面的「辦公桌」重看。
律師用 ChatGPT 找判例,交出 6 個根本不存在的案子
情境重現(依法院文件改寫)
📌 注意:罰款是因為律師「沒查證就交出去」,被質疑後還堅持;不是因為用了 AI。
最值得注意的是:律師不是完全沒有問。他追問了「這些案子是真的嗎?」,AI 仍然說是真的。AI 說「我確定」,不能替我們完成專業責任。
只記一句AI 說「我確定」不代表它是對的。越重要的事,越要自己查證。
出處:Mata v. Avianca, Inc., S.D.N.Y. (2023-06-22)。
RAG:讓 AI 從「閉卷考」變「開卷考」
閉卷考:只憑記憶
- 截止日後的事不知道
- 不懂你們公司的內部規章
- 想不起來就亂編
像沒帶課本就上台報告。
開卷考:RAG=先查再答
RAG 拆開是 Retrieval、Augmented、Generation,不用背英文,記成「找資料、補進去、再回答」就好。資料怎麼找?一種常見方式是把段落轉成代表意思的數字、找出意思相近的內容;也可以用關鍵字,或兩種合併。
RAG 能減少幻覺,但不保證每次都對。它附上出處,正是為了讓你方便核對,而不是看到引用就直接放心。
只記一句RAG=先查資料、再回答:減少幻覺,也讓 AI 能用上內部資料。
出處:Lewis et al. (2020) arXiv 2005.11401。
同事問 AI 助理出差規定,它答得很順,還說「依據差旅辦法第 5 條」。下一步最該做什麼?
- B 問「你確定嗎」:律師案已經示範過,AI 可以對錯誤內容再說一次「是,我確定」。
- C 有條號就相信:把專業的外觀當成證據。條號寫得出來,不代表它存在,也不代表適用你的情況。
- D 問兩個 AI:看起來最謹慎,但兩邊一樣仍可能都沒找到原始資料。答案一致可以當線索,不能代替查證。
看答案
答錯的話,回到上面的「律師假判例」與「RAG」重看。
想再多懂一點:LLM
先把這一幕讀完、小測驗做完,再挑一兩個來看。「官方」是 AI 公司自己出的入門資料;「史旺基專欄」是站上的進階文章,用到比較多工程術語。
第二幕,帶走這幾句
第二幕到這裡:LLM 會生成回答,重要內容則要回到來源確認。知道要查證之後,下一幕回到我們這一端——工作到底該怎麼交代?
- LLM 不是在查答案,是在接話:看著前文,一塊一塊(Token)猜出下一塊。
- 「機率最高」不等於「事實正確」。回答很順、很有自信,也可能是錯的。
- AI 本身不記得你說過什麼,每一輪都重讀整張桌子;聊太久就先摘要、再開新對話。
- 問「你確定嗎」不算查證。重要的事,自己點開原始出處核對。