Sam Altman 說新模型「省 54% Token」那天,阿哲差點又衝動換模型

阿哲(示意人物,一家承接海外客戶專案的接案團隊技術主管,非真實客戶)習慣在下午的咖啡空檔滑一輪科技新聞。那天他看到 CNBC Television 的一則專訪片段標題寫著:OpenAI 最新模型在「agentic coding」(讓 AI 自己規劃步驟、寫程式、跑測試的那種用法)上,比其他模型省下 54% 的 token。畫面裡,Sam Altman 對著主持人講得雲淡風輕,好像這是理所當然的進步。
阿哲的手指停在螢幕上,沒有立刻轉發到團隊群組。他想起三個月前那一次——也是看到某家模型廠商宣稱「效率大幅提升」,他二話不說把整條 agent 工作流換了過去,結果月底的帳單不但沒降,反而多了一截。他學到的教訓很簡單:別人講的「省」,不一定是你會省到的那個「省」。
CNBC 報的這句話,到底在講什麼
根據 CNBC Television 這支專訪片段,Sam Altman 向主持人表示,OpenAI 最新一代模型在處理 agentic coding 任務時,token 使用量比其他模型少了 54%。換句話說,就是所謂的「token 效率」提升了 54%——但這個詞本身,可以指很多不同的東西。
這裡有一個阿哲一開始也沒注意到的細節:「跟誰比」這件事,不同媒體轉述同一場專訪時講法並不完全一致。 CNBC 官網那支影片頁面的網址本身寫的是「比 Anthropic 最新的模型更有效率」(than Anthropic's latest),另有幾家科技媒體轉述提到,這個數字來自一項叫 ExploitBench 的基準測試——OpenAI 新模型跟對手模型打成平手的情況下,輸出的 token 量只有對方大約三分之一。換句話說,這比較可能是「跟競爭對手打分數」的橫向比較,而不是「OpenAI 自己新舊模型世代進化」的比較。這是專訪中的一句直接引述,CNBC 的片段本身沒有進一步拆解這個數字是怎麼算出來的——是指同一個任務完成所需的總 token 量下降、模型少走了幾輪「重試—修正」的迴圈、還是跟哪一款對手模型在哪一項基準測試上比較,CNBC 的片段本身並未細說。
阿哲很清楚,「agentic coding」跟平常聊天問答不一樣:模型要自己規劃步驟、寫程式碼、跑測試、看結果錯了再修一次,一個任務可能反覆循環十幾輪才收尾。這也是為什麼「省 token」這件事,在 agentic coding 情境下特別誘人——因為每一輪循環都在燒錢,理論上少繞幾圈,帳單就會有感下降。
一個百分比,可以是很多種意思
阿哲把這則新聞轉發到內部頻道前,先做了一件事:把「54% 更省」拆開來想清楚可能的幾種樣貌。
第一種可能,是模型本身「話變少了」——完成同一件事,輸出的 token 量天生比較精簡。第二種可能,是模型的規劃能力變強,少走幾次「試了才發現錯、要重來」的冤枉路,總輪次減少帶動總 token 減少。第三種可能,是官方測試用的是某一組特定的 benchmark 任務,換到阿哲團隊自己那些又亂又雜、常常需要跨多個檔案改動的真實專案上,情況可能完全不同。第四種可能,是阿哲後來查資料才想到的:這 54% 說不定根本不是跟 OpenAI 自己的上一代模型比,而是跟另一家公司的模型比——如果是「打對手」打出來的數字,跟「自己世代進化」比出來的數字,對「我換了新模型帳單會不會降」這個問題,答案可能完全不一樣,前者甚至可能跟阿哲團隊現在用的模型無關。
這幾種「省」對阿哲團隊實際帳單的影響天差地遠,而 CNBC 這支專訪片段本身沒有回答是哪一種。 這正是本文特別提醒讀者的地方:任何「模型 X 比模型 Y 省 N%」的宣稱,若沒有講清楚衡量基礎(同一組任務、同一種計費方式、官方 benchmark 還是第三方獨立測試),都只能先當成「值得關注的方向」,不能直接當成「你會省到的數字」。
轉折:他發現自己根本沒有「基準線」可以拿來比
阿哲原本想直接問工程師:「如果換成這顆新模型,我們能省多少?」但問完他才驚覺一件更根本的事——他們團隊從來沒有正式量過,現在這套 agentic coding 工作流,每完成一個典型任務平均要燒多少 token。 上次換模型的教訓,不是「新模型不夠好」,而是他們沒有「換之前」的真實數字可以拿來對照,只能憑感覺判斷「有沒有省」,結果帳單一多,才後知後覺發現根本沒省到。
他這才意識到,真正該問的問題從來不是「Sam Altman 說的 54% 準不準」,而是:如果連自己現在的用量基準線都沒有,任何官方宣稱的百分比,對他來說其實都是沒有座標的數字。
他這次沒有急著換,先做了另一件事
這一次,阿哲沒有立刻把 agent 工作流切過去。他先讓團隊把最近兩週跑過的典型任務——那種一定會用到 agentic coding 反覆規劃、寫碼、跑測試的案子——的 token 用量記錄下來,模型、任務類型、完成輪次、總 token 量都攤開來看。等這條基準線抓穩了,未來不管哪家廠商說「更省 X%」,他們都能拿真實數字對照,而不是憑一則新聞標題做決定。
對台灣的中小型接案團隊或開發團隊來說,這其實是評估任何「效率提升」宣稱前該有的第一步:不是先相信百分比,而是先看得見自己現在的用量,才有資格判斷別人講的「省」對你是不是真的省。
FAQ
Q1:Sam Altman 說的「省 54% token」是官方保證的數字嗎?跟誰比的?
不是官方保證數字。這是 Sam Altman 在 CNBC Television 專訪中的一句口頭引述,並非 OpenAI 官方發布的定價文件或正式 benchmark 報告。而且連「跟誰比」都不完全清楚:多家媒體轉述同一場專訪,講法並不一致——有的著重在跟自家舊模型比,CNBC 官網影片頁面網址本身則寫的是跟 Anthropic 最新模型比較(than Anthropic's latest),另有轉述提到數字來自 ExploitBench 這項基準測試下、跟對手模型打平手時的 token 用量比較。本文引用時一律標註為「CNBC 報導引述」,其準確衡量基礎待 Alice Wu 對照 OpenAI 官方公開資訊複核,讀者不應直接將其視為自己會省到的成本比例。
Q2:什麼是「agentic coding」,為什麼它特別會燒 token?
指讓 AI 自己規劃步驟、寫程式、執行測試、依結果修正再重跑的使用方式,跟單純問答不同,一個任務常需要反覆循環多輪,每一輪都會消耗 token,因此累積下來的用量往往比想像中高出許多。
Q3:看到「模型更省 token」的新聞,企業該怎麼評估要不要換模型?
建議先確認宣稱的衡量基礎(是官方 benchmark、獨立測試,還是像本篇這種專訪引述),再對照自己團隊實際任務的用量基準線做小範圍測試,而不是直接依單一新聞標題全面切換,避免重演「宣稱更省、實際帳單沒降」的落差。
Q4:我們團隊目前沒有記錄 token 用量基準線,該怎麼開始?
可以先從最常跑的幾種典型任務著手,記錄使用的模型、任務類型、完成所需輪次與總 token 量,累積兩到三週的數據,之後任何模型比較或廠商宣稱,都能拿真實數字對照,而不是憑印象判斷。
資料來源聲明
本文參考自 YouTube 頻道 CNBC Television 於 2026 年 7 月 9 日發布的影片《OpenAI's newest AI model is 54% more token efficient on agentic coding, Sam Altman tells CNBC》,並經重新組織與論述改寫,非逐字翻譯。經 Alice Wu 複核比對,同一場專訪另有 CNBC 官網報導與多家科技媒體(如 TechStartups)轉述,對「54% 是跟誰比」的描述並不完全一致,本文已在正文與 FAQ 中如實呈現此不一致,不逕自替讀者判定為單一定論。文中「阿哲」為說明用示意人物,非真實客戶案例。文中所有關於「54% 更省 token」之敘述,均為引用 Sam Altman 於 CNBC 專訪中的說法及其他媒體轉述,非 OpenAI 官方定價或效能保證文件,不構成任何成本節省承諾,讀者評估自身導入效益時應以實測數據為準。
延伸閱讀
立即行動
別急著相信下一則「更省 X%」的新聞標題。免費試用 AI Token King,讓我們幫你把 GPT、Claude、Gemini 等不同模型在 agentic coding 任務上的真實 Token 用量攤開來看,先建立自己的基準線,未來任何效率宣稱都能拿數字對照,而不是憑感覺決定要不要換模型。

留言