top of page

AI 模型是怎麼訓練出來的?ChatGPT、Claude 從預訓練到對話助理的完整過程

  • 7月9日
  • 讀畢需時 11 分鐘

你是不是也好奇過,ChatGPT、Claude 這些每天在跟你對話的 AI,裡面到底裝了什麼?不管你查的是 AI 模型是怎麼訓練的、ChatGPT 原理、Claude 怎麼運作,還是想知道大型語言模型(LLM)到底在學什麼,背後其實都在問同一件事:這台機器是怎麼從一堆文字,變成一個會回答你問題的助理?

答案可以拆成兩大階段:先用整個網路等級的文字資料「預訓練(pretraining)」出一個會接龍造句的語言模型,再用「後訓練(post-training)」把它調教成會聽指令、會對話的 AI 助理。中間還牽涉到 Token 怎麼切、資料怎麼清、模型評估怎麼做,以及為什麼「模型越大、資料越多,效果就越好」這件事其實可以被公式預測出來。

這套完整拆解來自史丹佛大學 CS229 機器學習課的一堂客座演講,講者 Yann Dubois 除了是史丹佛 NLP 實驗室的博士生,也是開源模型 Alpaca 的核心作者之一。他把訓練一個 LLM 拆成五大關鍵組成,並老實告訴大家:業界真正花最多力氣的地方,其實不是媒體最愛談的「模型架構」。如果你之前讀過AI Token 是什麼?新手一次看懂 AI 為什麼一直提到 Token,這篇會帶你往下一層看:Token 背後那台「造句機器」,究竟是怎麼被訓練出來的。

AI 模型訓練的五大關鍵,你以為重要的其實不是重點

Dubois 一開場就點出訓練 LLM 要盯緊五件事:架構(architecture)、訓練損失與演算法、資料(data)、評估(evaluation)、系統工程(systems)

你可能會猜「架構」最重要——畢竟媒體最愛講哪家又發表了什麼新模型。但 Dubois 直接承認,學術界(包含他自己過去大半個職業生涯)最愛鑽研的正是架構,實務上真正決定一個模型好不好用的,反而是資料、評估和系統這三塊「不性感」的工作。這也是為什麼這場演講幾乎不談架構細節,而是把重心放在業界真正燒錢燒時間的地方。

換句話說:AI 競賽的護城河,越來越不是誰的模型架構比較新穎,而是誰的資料與工程基礎建設比較扎實。

預訓練是什麼?本質上是一台超大型的「接龍機器」

預訓練是訓練 LLM 的第一階段,對應到大家熟悉的 GPT-2、GPT-3 這類「純語言模型」。它的任務說穿了很簡單:給定前面出現過的文字,預測下一個字最可能是什麼。

這種模型叫做「自迴歸語言模型」,運作邏輯是機率鏈:先算第一個字出現的機率,再算「看到第一個字之後,第二個字出現的機率」,依此類推,把一整句話的機率拆解成一連串的條件機率相乘。訓練時用的損失函數是交叉熵——白話說就是,模型猜的下一個字如果跟真實答案不一樣,就調整參數,讓它下次猜對的機率更高。如果你想知道這套「自迴歸」機制怎麼直接影響你的 AI 帳單,可以參考AI Token 為什麼這麼貴?從自迴歸運作原理拆解 Coding Agent 燒錢的真相,那篇專門講這件事怎麼燒錢;這篇則帶你看完整的訓練全貌。

有意思的是,語言模型天生沒有「標準答案」的概念,它只是在模仿網路上人類寫作的統計規律。這也解釋了為什麼一個只經過預訓練、沒調教過的模型,如果你問它「跟六歲小孩解釋登月任務」,它可能會回你「跟六歲小孩解釋重力理論」——因為它只是在模仿「網路上常見的問題清單長什麼樣子」,而不是真的在「回答問題」。這正是為什麼還需要「後訓練」這個階段,稍後會講到。

Token 是怎麼切出來的?為什麼這件事直接決定你的帳單

模型看到的從來不是完整的「字」或「詞」,而是 Token(子詞單位)。為什麼不直接用整個字當單位?Dubois 給出兩個關鍵原因:

  • 用「字」當單位太脆弱:如果一個字打錯、拼錯,模型可能根本沒看過這個字對應的 Token,不知道怎麼處理。而且像泰文這類語言,詞與詞之間根本沒有空格,無法用空格切字。

  • 用「單一字元」當單位又太沒效率:如果每個字母都是一個 Token,句子長度會爆增,而 Transformer 的運算複雜度是隨序列長度「平方成長」的——句子變長,運算成本會用倍數暴增。

於是業界普遍採用「位元組對編碼(BPE)」這類演算法:先把每個字元當成獨立 Token,再統計整個訓練語料中最常一起出現的 Token 配對,不斷合併成新的、更長的 Token,重複這個過程直到達到目標的字彙表大小。這也是為什麼英文的一個 Token 平均大約是 3-4 個字母的長度(如果你想知道中英文差異更細的算法,可以直接對照一個 AI Token 等於多少字?中文和英文其實差很多)。

這裡有個很多人沒想過的細節:Token 的切法會直接影響模型的數學能力和程式碼理解能力。 數字如果被切成奇怪的 Token(比如 327 被當成一整個 Token,而不是「3」「2」「7」分開處理),模型就很難像人類一樣逐位運算,這也是為什麼 LLM 常常在多位數運算上出錯。GPT-4 當年一項重要改動,就是重新設計了程式碼的 Token 切法(例如正確處理 Python 常見的縮排空格),讓模型對程式碼的理解大幅提升。

也就是說,不同模型的 Tokenizer 不一樣,同一段文字被切成的 Token 數量就不一樣,直接反映在你的用量計費與模型表現上——這不只是技術細節,是實際會影響你荷包的變數。

AI 是拿什麼資料訓練出來的?從「整個網路」到能用的資料要經過幾道關卡

你可能以為「用整個網路的資料訓練」就是把網路內容直接倒進模型裡,但 Dubois 直言:隨便下載一個網頁,你會被裡面的內容嚇到——那絕對不是你想像中乾淨的維基百科等級文字。

實際的資料處理要經過好幾道關卡:

  • 網路爬取:業界普遍使用像 Common Crawl 這類公開爬蟲資料庫,目前累積約 2,500 億個網頁、約 1PB 資料量。

  • 文字擷取:從雜亂的 HTML 中抽出真正的內文,數學公式擷取這類細節特別難處理。

  • 內容過濾:去除色情、暴力等不當內容以及個資,通常用黑名單網站清單搭配小型分類模型自動判斷。

  • 去重複:網路上大量重複的頁首頁尾、轉貼文章、書籍段落都要去除,否則模型會過度學到這些重複內容。

  • 品質篩選:用「維基百科引用過的連結」當作高品質的判斷基準,訓練小型分類器篩掉低品質網頁。

  • 資料配比調整:提高程式碼資料的比例可以顯著提升模型的推理能力,書籍類資料通常也會被加權,純娛樂類內容則常被降權。

規模上,Meta 的 Llama 2 用了 2 兆個 Token 訓練,Llama 3 暴增到 15 兆 Token,是目前公開已知規模最大的訓練資料量之一。Dubois 坦言:資料處理這塊,人類至今根本還沒有「解決」——效率、資料配比、合成資料生成、著作權爭議,一大堆問題都還沒有標準答案,也是各家公司最不願意公開細節的環節,一部分是競爭考量,一部分是版權責任問題。

「模型越大、資料越多,效果就越好」這件事,真的可以被公式預測

這是整場演講最反直覺、也最關鍵的概念:Scaling Laws(縮放定律)。

一般機器學習教的是「過擬合」——模型太大、訓練太久,效果反而變差。但 LLM 打破了這個直覺:數據顯示,模型越大、訓練資料越多,測試效果幾乎是線性可預測地持續變好,目前為止還沒看到明顯的天花板。這個規律最早由 OpenAI 在 2020 年提出並得到驗證。

這對公司來說商業意義很大:不用再拿最終規模的模型去反覆試錯調參數,而是可以先在小規模模型上做實驗,擬合出一條縮放曲線,直接外推預測放大 10 倍、100 倍效果會變成怎樣——大幅降低訓練超大模型的風險與浪費。

其中最著名的延伸研究是 DeepMind 的 Chinchilla 論文,它回答了一個核心問題:同樣的運算預算,該花在「更大的模型」還是「更多的資料」?結論是存在一個最佳比例(理論最佳值約為每個參數配 20 個 Token;但考量到後續推論成本,業界實務上更常用接近每個參數配 150 個 Token 的比例,傾向訓練相對小一點、但吃更多資料的模型,因為部署後長期的推論成本遠比訓練成本可觀)。

Dubois 也用 Llama 3 400B 算了一筆概算帳:訓練用掉約 1.66 萬張 H100 GPU、耗時約 70 天,光是租用 GPU 的成本粗估就超過 5,000 萬美元,加上人事成本,整體訓練成本估算落在 7,500 萬美元左右——這還只是「練一次」的成本,不含後續每天服務數億用戶的推論成本(推論成本其實遠比訓練貴,如果你也在算 AI Coding Agent 這類高頻使用場景的真實開銷,可以參考AI Token 真實成本是多少?為什麼你的 AI 訂閱費感覺特別便宜)。

ChatGPT、Claude 是怎麼「調教」出來的?後訓練兩階段

有了一個會接龍的預訓練模型後,真正讓它變成會乖乖聽指令對話的助理,靠的是後訓練,主要分兩步。

第一步:監督式微調(SFT)

作法很直觀:找人類寫出「這是問題、這是我們想要的標準答案」的資料,拿這批資料微調預訓練模型,教它學會像助理一樣回答問題的格式與語氣。

意外的是,SFT 其實不需要太多資料——LIMA 論文發現,把 SFT 資料量從 2,000 筆擴大到 32,000 筆,效果幾乎沒有提升。原因是模型在預訓練階段早就「見過」各種回答問題的方式,SFT 真正在做的不是教模型新知識,而是校準它去模仿其中一種特定的說話風格。

但 SFT 有三個代價很高的問題:一是人類寫的答案品質有上限;二是可能加劇「幻覺」——如果人類教的答案裡有模型從沒見過的知識,模型學到的其實是編一個聽起來很像真的內容,而不是誠實承認不知道;三是找人類逐字寫出理想答案,成本非常高。

第二步:人類反饋強化學習(RLHF)與更簡化的 DPO

RLHF 不再要求人類「寫出」完美答案,而是讓模型生成兩個候選答案,請人類(或現在越來越常用另一個 AI 模型)標註哪一個比較好,再用這個偏好資料訓練模型多產生大家喜歡的回答。

早期業界(包含 ChatGPT 最初的做法)採用強化學習演算法 PPO,但 PPO 出了名的複雜、難以除錯。史丹佛團隊後來提出更簡化的替代方案 DPO(Direct Preference Optimization),數學上證明兩者的最佳解等價,但 DPO 不需要另外訓練獨立的獎勵模型,大幅簡化了整個流程,目前已成為開源社群乃至業界的主流做法之一。

為什麼 ChatGPT 的回答常常落落長?評估 AI 助理比想像中更難

判斷「ChatGPT 好不好用」比判斷「語言模型準不準」難得多,因為助理的答案是開放式的,沒有標準答案可以比對。那要怎麼知道一個模型到底有沒有變好?

演講中一個很有意思的觀察:人類標註者在做「這兩個答案哪個比較好」的判斷時,自己前後判斷的一致率只有大約 66%——即便是研究論文的作者群自己下場標註,花了好幾個小時討論標準,一致率也才 67-68%。評估 AI 回答好壞,本質上就是一件極其主觀的任務。

更麻煩的是,人類和用來取代人類評分的 AI 模型,都存在同一種系統性偏誤:普遍偏好比較長的答案,而不是比較正確或切題的答案。這正是為什麼經過大量 RLHF 調教的模型,回答傾向越來越長——因為訓練過程中「更長」不斷被誤判為「更好」。研究團隊實測發現,同樣是 GPT-4,如果提示詞要求它「回答詳細一點」,勝率可以從 50% 衝到 64.4%;要求它「簡潔一點」,勝率則掉到 20%,這個偏誤的影響幅度相當驚人。

目前業界比較被信任的人工評估基準是 Chatbot Arena(讓真實使用者盲測兩個模型並投票);自動化評估則越來越倚賴用強大的 AI 模型取代人工評分,成本可以降到幾分鐘、不到 10 美元一輪,且與人類評分的相關性可達 98%,但同樣要留意上述「偏好長答案」的系統性偏誤。

算力有多貴?系統工程才是真正燒錢的地方

演講尾聲點出一個很多人沒意識到的現實:就算你有一大筆錢,也不一定能「買到」最好的 GPU——除了昂貴,更稀缺,而且多顆 GPU 之間的溝通延遲是實體限制,不是砸錢就能解決的問題。業界公認的指標「模型 FLOP 使用率」用來衡量實際運算效率相對理論上限的比例——像 Meta 訓練 Llama 能達到 45% 左右就已經算不錯,代表即便是最頂尖的公司,GPU 大多時間也並非滿載運轉。

一個具體可行的優化技巧是「低精度運算」:把浮點數運算精度從常見的 32 位元降到 16 位元,深度學習本身容許相當程度的數值誤差,精度降低換來的是傳輸資料量減半、運算速度大幅提升。

看懂這套原理,對你選 AI 模型有什麼幫助?

看完會發現,一個 AI 模型的能力邊界,遠遠不只是「模型夠不夠聰明」這麼簡單,背後牽涉到資料清洗的品質、Token 切分的方式、後訓練調校的偏好機制,以及龐大的算力與系統工程投入。這也是為什麼你在評估、採購或串接不同的 AI 模型時,不能只看參數量或行銷話術:同樣一句提示詞,丟進不同模型,消耗的 Token 數量不同、輸出風格也可能因為後訓練偏好機制而系統性偏長或偏短。

這正是 AI Token King 想幫你解決的問題——讓你看懂並管理跨模型的 Token 用量,不用再被各家模型黑盒子般的定價與行為牽著走。

常見問題(FAQ)

Q1:預訓練和後訓練有什麼差別? 預訓練是用整個網路等級的海量文字,訓練模型學會接龍語言的統計規律;後訓練則是用相對少量、但精心挑選的人類偏好資料,把這個接龍模型調教成會聽指令、像助理一樣對話的產品。兩者用的損失函數數學上其實相似,關鍵差異在於資料的來源與規模。

Q2:為什麼 AI 模型有時候會一本正經地胡說八道(幻覺)? 其中一個重要成因來自後訓練階段:如果人類標註者提供了一個模型在預訓練時沒真正學過的知識點當作標準答案,模型學到的其實是生成一個聽起來很有道理的答案,而不是誠實表示不確定。

Q3:為什麼不同 AI 模型,同一段文字算出來的 Token 數量會不一樣? 因為每家公司用的 Tokenizer(字彙表大小、切分邏輯)不同,同一句話被切成的 Token 數量自然不同,這也直接影響到你使用該模型的實際計費與效能表現。

Q4:模型越大是不是就一定越好?訓練會不會有天花板? 根據目前已驗證的 Scaling Laws,在可觀察的範圍內,模型與資料規模持續放大,效果確實持續、可預測地提升,尚未觀察到明顯的天花板,但多數研究者預期這個趨勢終究會趨緩。

Q5:一般企業或開發者,需要理解到這麼技術性的細節嗎? 不需要從頭訓練模型,但理解這些原理有助於你做出更聰明的判斷:為什麼不同任務適合搭配不同模型、為什麼同一份提示詞在不同平台的成本天差地遠、為什麼模型偶爾會胡說八道——這些都不是玄學,而是有跡可循的工程與訓練機制。

資料來源

  • Yann Dubois,Stanford CS229: Machine Learning — Building Large Language Models (LLMs),Stanford University,2024。YouTube 官方影片

  • 相關研究引用(依演講內容提及):OpenAI Scaling Laws for Neural Language Models(2020)、DeepMind Chinchilla、Stanford DPO: Direct Preference Optimization、LIMA: Less Is More for Alignment、Alpaca 專案

延伸閱讀

想知道你的團隊在不同 AI 模型上實際用了多少 Token?立即免費試用 AI Token King,一次看懂所有模型的用量。

留言


bottom of page