AI 想變聰明:從人教到自己學
在會說話的 AI 出現以前,人類已經花了幾十年,試過好幾種「教」機器變聰明的方法。這一幕快速走過 1950 到 2016 年,看三種很不一樣的做法——記住最後那個轉彎就好。
在會說話的 AI 出現之前,人類是怎麼「教」機器變聰明的?
在會說話的 AI 出現以前,你覺得「教機器變聰明」有哪幾種教法?
想好了,看這一幕的三種做法
這一幕快速走過 1950 到 2016 年,會看到三種很不一樣的做法:
- ELIZA:套句型裝懂。抓關鍵字、套固定句型,讓它看起來能聊天。
- 專家系統:人來寫規則。請專家把經驗寫成規則,交給電腦照表做。
- 機器學習:機器自己從資料學。不再把規則全部寫完,而是給大量資料,讓機器自己找出規律。
關鍵的轉彎是:從「人把規則教完」,變成「機器從資料裡學」——這也是下一幕理解 LLM 的起點。
從「人把規則教完」,到「機器從資料學」
先看全貌:前半段,人類想辦法把聰明「寫進去」;後半段,改成讓機器自己從資料裡「學出來」。點年份下的標題,可以直接跳到那個故事。
只記一句六個年份,三種做法:套句型、人寫規則、機器從資料學。
1950 年:「機器能思考嗎?」
英國數學家圖靈提出這個問題,但他覺得光爭論「什麼叫思考」太模糊,很難得到清楚的答案,於是把它換成一個遊戲。這就是後來常聽到的圖靈測試。
猜得出哪個是機器
機器還沒過關。
裁判猜不出來
就算機器過關:它的表現已經讓人分不出來。
1955 年:提案
四位學者提出計畫書,開頭就寫下 Artificial Intelligence(人工智慧),這個名字從此誕生。
1956 年:研討會
計畫書提議隔年夏天,在美國達特茅斯學院開研討會。要分清楚:1955 是提案,1956 是研討會。
當時好樂觀
他們以為 10 個人、2 個月 就能有重大突破。
結果這題做了 70 年,到現在還在繼續。
這一段不用記一串人名,先記住:人類很早就想知道,機器能不能表現得像有智慧。有了這個問題,接著真的有人做出能跟人聊天的程式。
只記一句圖靈測試看的是「表現」:隔著文字分不出來,就算過關。
出處:Turing (1950) Mind 59(236);McCarthy et al. (1955) 達特茅斯計畫書。
ELIZA:只會把你的話換句話問回來,人卻當真了
ELIZA 的對話(依 1966 年論文範例改寫)
我猜好了,看 ELIZA 怎麼回
ELIZA 回:「聽到你很沮喪,我很遺憾。」看起來有接住你的情緒,但它只是把關鍵字「沮喪」放回固定句型:
整個過程沒有「理解」:換成任何一句含「沮喪」的話,它都會這樣回。
後面還會遇到:AI 的「幻覺」——很有自信地講出錯誤或不存在的內容,就是同一個陷阱(見第二幕:LLM 的三個脾氣 )。
只記一句講得像懂 ≠ 真的懂。
出處:Weizenbaum (1966), CACM 9(1);Weizenbaum (1976)《Computer Power and Human Reason》。
1980 年代,專家系統:
把經驗寫成「如果…就…」規則
如果套句型不夠,能不能把專家的判斷寫進去?想法很直覺:專家怎麼判斷,就寫成「如果遇到這個條件,就做那個動作」的規則,交給電腦照表做。這就是專家系統。
真的有用:XCON
當時的電腦大廠 DEC 用專家系統 XCON 檢查客戶訂的電腦零件有沒有配錯(像幫你檢查組電腦的零件清單),據稱每年省下約 2,500 萬美元。
但例外永遠寫不完
世界太複雜。規則越寫越多,改一條會牽動一堆,最後要專門團隊一直維護。方法有用,但把所有例外寫完,成本越來越高。
不到十年,規則多了十幾倍。每多一個例外,就要多補一條規則。
想一想:你的工作上,有沒有一份越寫越厚、每次修改都很小心的規則文件?專家系統遇到的,就是類似的難題。
只記一句當「人把規則全部寫完」越來越困難,研究方向就需要轉彎。
出處:Polit, “R1 and Beyond”, AI Magazine(1980 年約 750 條);Barker & O'Connor (1989) CACM 32(3)(1 萬條以上);Wikipedia「Xcon」;Lighthill Report (1973);Wikipedia「AI winter」。
教機器認貓:人寫規則 vs. 讓它自己學
規則如果永遠寫不完,是不是可以改成讓機器看例子、自己學?拿「認貓」來看這個轉彎。
- 折耳貓?
- 只拍到背影?
- 玩偶貓?
規則寫不完:每多一個例外,就要多補一條規則。
左邊:人寫規則
有尖耳朵、有鬍鬚、四隻腳,所以是貓。聽起來合理,但折耳貓、背影、玩偶貓都會讓規則失靈,只好一直補。
右邊:機器學習
不先把貓的長相寫清楚,而是給機器大量已經標好答案的照片,讓它自己找出照片和答案之間的規律。
深度學習
很多層的「人工神經網路」(模仿腦細胞連結方式的計算方法),一層一層找特徵:先看線條、局部形狀,最後認出比較完整的貓臉。
2012 年那場認圖大賽,讓模型對每張照片提出 5 個猜測,5 個都沒猜中才算錯。AlexNet 的錯誤率是 15.3%,同一屆第二名是 26.2%。這是兩個參賽結果的比較,不是同一個系統改版前後的數字。不用背錯誤率,記住下面這句就好——接下來的語言模型,也是沿著「從資料學習」這個方向發展。
只記一句從「人教規則」變成「機器從資料學」:這是 AI 歷史最重要的轉彎。
出處:ILSVRC-2012 官方成績(猜 5 次的錯誤率);Krizhevsky, Sutskever & Hinton (2012)。
2016 年 AlphaGo 第 37 手:萬分之一的一步
學會從資料找規律以後,機器甚至開始做出超出老師習慣的選擇。Google DeepMind 的 AlphaGo 在首爾以 4 比 1 擊敗頂尖棋士李世乭。
它厲害的地方不只是算得快,而是學會哪些下法比較值得進一步計算:不是把每條路都同樣認真走一遍,而是先選出比較有希望的方向,再往下看。
1997 年 IBM 深藍(西洋棋)
示意:大量下法都算一遍贏了西洋棋世界冠軍,靠每秒算 2 億個棋局的「暴力計算」,加上人寫的評分規則。但圍棋的變化多到算不完。
2016 年 AlphaGo(圍棋)
示意:只試走看起來最有希望的幾步像高手一樣,只在腦中試走幾步「看起來最有希望」的棋,不是每一步都算。而「哪幾步有希望」,是它自己學出來的。
只記一句那時的 AI 只會下棋這一件事,下一步,人們想讓它學會「語言」。
出處:DeepMind AlphaGo 官方頁;IBM History: Deep Blue;Silver et al. (2016) Nature 529:484。
AI、機器學習、深度學習、LLM:一圈包一圈
往語言前進之前,先把前面出現的名詞排一排。這張入門圖用一圈包一圈的方式定位:越往內,範圍越小、越專門。
- AI 人工智慧方法不限讓機器做需要智慧的事;人寫規則也算。例:圖靈、ELIZA、專家系統
- 機器學習從資料自己學例:認貓、AlphaGo
- 深度學習一層層找特徵:線條→耳朵→貓臉用多層的人工神經網路;2012 年 AlexNet 起爆紅
- 生成式 AI產生新內容文字、圖片、聲音、影片
- LLM核心是語言ChatGPT、Gemini、Claude 背後的大型語言模型;新一代還會看圖、聽聲音(多模態,例:GPT-4o)
不用把每一圈的邊界背得很死。先把一句話講清楚就好:
只記一句LLM 是生成式 AI 裡以「語言」為核心的那一類,不是所有 AI 的總稱。
出處:Rombach et al. (2022) arXiv 2112.10752(Stable Diffusion);OpenAI「Hello GPT-4o」(2024-05-13)。
下面哪一個,是「機器學習」的做法?
- A 是專家系統:規則由人先寫好。
- B 是 1966 年的 ELIZA:找關鍵字、套句型。
- C 是 1997 年深藍的做法:暴力計算,算得快不代表學到規律(見上面的 AlphaGo 第 37 手)。
這也不是說會學習的系統就不計算:AlphaGo 一樣會計算,差別是它先從棋譜和自己跟自己下棋,學出「哪幾步值得算」。不要把「計算」和「學習」當成只能二選一。
看答案
自學計分:先選定再看解答;答錯的話,回到上面的 「教機器認貓」 重看左右對照。
想再多懂一點:AI 想變聰明
先把這一幕讀完、小測驗做完,再挑一兩個來看。「官方」是 AI 公司自己出的入門資料;「史旺基專欄」是站上的進階文章,用到比較多工程術語。
第一幕,帶走這幾句
第一幕到這裡:機器學會從資料自己找規律,但那時的 AI 只會下棋這類單一件事。下一幕,人們把資料換成「語言」——而我們的工作,很多正是靠文字交代、理解和完成的。
- 教機器有三種做法:套句型裝懂(ELIZA)、人來寫規則(專家系統)、讓機器從資料自己學(機器學習)。
- 講得像懂 ≠ 真的懂。回答自然、有禮貌、很有自信,不代表內容可靠。
- 例外永遠寫不完;AI 歷史最重要的轉彎,是從「人教規則」變成「機器從資料學」。AlphaGo 也不只是算得快,而是先學出「哪幾步值得算」。
- AI 包住機器學習,機器學習包住深度學習,再往內是生成式 AI 和 LLM:LLM 是以語言為核心的那一類,不是所有 AI 的總稱。