top of page

Opus 4.8 vs Fable 5 實測:同一個 App、同一組指令,兩大模型的能力與 Token 成本差多少

7月11日
讀畢需時 7 分鐘

最近有一支在 YouTube 上累積近 90 萬觀看的實測影片,做了一件很多人想看卻很少人認真做的事:把完全相同的指令同時丟給 Anthropic 的 Opus 4.8 和新旗艦模型 Fable 5,各自一次成形、不做任何修改、直接部署上線,然後正面對比。更難得的是,作者還自己做了一個用量追蹤器,把每一次生成的輸入 Token、輸出 Token、以及換算成本都攤出來看。這篇文章會幫你把這場實測的重點整理清楚——不只是「誰做得比較漂亮」,而是對正在選模型、抓 Token 預算的人真正有用的那部分:能力差距與成本差距,其實是兩條不一樣的線。

先講一個前提,避免你把這篇當成官方評測:以下所有數字與結果,都來自這位開發者(頻道 Pat Simmons)的單次、一次成形(one-shot)實測,不是可重複驗證的標準跑分。同一組指令換個時間、換個人跑,結果可能不同。所以請把它當成「一個貼近真實使用場景的案例」,而不是「模型能力的最終定論」。

這場實測是怎麼設計的?

作者給兩個模型的規則完全一樣,這是整場對比可信度的基礎:

  • 同一組指令:兩邊拿到逐字一模一樣的提示詞

  • 一次成形(one-shot):只給一次輸出機會,不做反覆修改、不回頭補救

  • 直接上線:生成結果實際部署到網路上,用真實可操作的成品來評斷,不是看截圖

在這個規則下,作者連續做了三個難度遞增的專案:一個完整的電商網站、一個可互動的 3D 藝術史美術館、以及一個《世紀帝國》風格的即時戰略遊戲。三個專案分別考驗不同的能力——前端設計、資料庫架構、外部 API 串接、以及最難的 3D 世界即時渲染。

三場實測,結果一面倒

第一場:電商網站。 兩個模型都被要求做一個虛構蠟燭品牌的完整電商站,包含 30 個各自不同的商品、landing page、資料庫。Opus 4.8 的成品是可用的——文字清楚可讀、商品有標籤(比作者先前用其他工作流測試時好),但有些細節不夠細膩,像是版位配色、按鈕設計、分類篩選略顯雜亂。Fable 5 則在同樣的指令下,做出明顯更乾淨的介面:更好的按鈕、漸層背景、更貼近真實電商的通知列,甚至在「如何提示圖片生成模型」這件作者完全沒教的事情上,Fable 5 自己就把商品情境照的美感處理得更好。

第二場:3D 藝術史美術館。 這是作者說「試了好幾年、沒有一個模型做到過」的專案:一個可縮放的藝術史時間軸,點進某位藝術家能看到他的介紹,再進到一個 3D 畫廊實際「走」進去看畫,所有畫作資料從維基媒體 API 抓取。結果Fable 5 不只完成了,還做出可以用滑鼠在畫廊裡走動、觀看近千幅畫作的沉浸式體驗,過程中自己主動抓出資料錯誤(例如某位藝術家的維基條目命名帶括號導致分類錯誤)並修正。Opus 4.8 的時間軸視覺做得不錯,但關鍵的畫廊互動點不進去——畫布的拖曳操作蓋掉了點擊事件,等於最核心的功能是壞的。

第三場:《世紀帝國》風格遊戲。 難度最高的一場,要做一個瀏覽器裡可玩的 3D 即時戰略遊戲。Opus 4.8 的成品作者判定基本無法操作——單位像色塊、畫面無法移動、蓋不了建築。Fable 5 則做出一個地圖可導航、單位有盔甲細節、畫面接近真實遊戲水準、實際可玩的版本。

三場下來,作者的結論是 Fable 5 明顯勝出。但真正值得評估預算的人細看的,是下一段的成本數字。

關鍵的成本數據:Fable 5 更省 Token,但總價反而更貴

這是整支影片對「抓 Token 預算」的人最有價值的部分。作者的用量追蹤器記錄了兩個模型在各專案的實際 Token 消耗與換算成本(以下數字為作者影片中的實測記錄,成本為其依「若採用量計費」假設換算的估計值,非官方定價):

  • 電商站:Opus 4.8 約 198,000 個輸出 Token、估計約 21 美元;Fable 5 約 188,000 個輸出 Token、估計約 37 美元

  • 3D 美術館:Opus 4.8 輸入約 51,000、輸出約 437,000 Token、估計約 46 美元;Fable 5 輸入約 54,000、輸出約 280,000 Token,換算下來約貴 37%

看出弔詭的地方了嗎?在 3D 美術館這場,Fable 5 用的輸出 Token 明顯比 Opus 4.8 少(280,000 對 437,000),也就是它「更省 Token」;但最終換算成本卻更貴約 37%。這不是矛盾,而是揭示了一件評估成本時很容易搞混的事。

「更省 Token」跟「更便宜」是兩件不一樣的事

一個模型的實際帳單,是用量 × 單價兩個變數相乘的結果。Fable 5 在這場實測裡展現的是「用更少的 Token 完成更複雜的任務」——這是用量端的效率;但如果它的每 Token 單價比 Opus 4.8 高,那麼即使用量下降,只要單價漲幅超過用量降幅,總帳單還是會往上走。這正是這場實測出現「更省 Token 卻更貴」的原因。

對正在做模型選型或預算規劃的團隊,這帶出一個很實務的判斷點:不要只看「哪個模型比較省 Token」就下結論,也不要只看單價。真正決定帳單的是兩者相乘後的結果,而且會隨你的任務類型(簡單問答 vs. 複雜的多步驟 agent 工作)大幅浮動。作者也提到,他訂閱的是固定額度的訂閱方案(Max 20X),光是在同一場專案裡同時讓兩個模型一起跑,30 分鐘就燒掉了他當月約 40% 的用量額度——這也再次印證了 AI Coding Agent 的 Token 消耗會非線性放大這件事。

這對正在選模型、抓預算的人代表什麼

把這場實測的觀察收斂成幾個可以直接用的判斷點:

  • 能力差距明顯時,貴一點可能是划算的:如果 Fable 5 能一次做到 Opus 4.8 做不到的成品(例如可互動的 3D 畫廊、可玩的遊戲),那麼多付約 37% 換一次成功、不用來回修改的時間,對某些任務可能反而省成本。成本不能只算帳單,也要算「失敗重來」的隱形成本。

  • 簡單任務未必要用最貴的模型:反過來說,如果你的任務是結構單純、不需要複雜架構的工作,能力較低但單價可能較低的模型或許就夠用,把旗艦模型留給真正需要的複雜任務。

  • 計費模式即將改變時,要提早留意:影片中提到 Fable 5 預計在數週後轉為用量計費(usage-based pricing)——這是作者影片當時(2026 年 6 月)的說法,實際計費方式與時程請以 Anthropic 官方公告為準。但背後的提醒值得記住:訂閱制與用量制的成本結構完全不同,切換之後你的實際花費可能與現在的體感差很多。

  • 建立你自己的用量追蹤機制:這位作者做對的一件事,就是他自己做了一個 Token 用量追蹤器,才能把「更省 Token」和「更貴」這兩件事拆開來看。與其等帳單來才驚訝,不如提早把用量與成本攤在眼前。

FAQ

Q1:這場實測的結果,可以當成 Opus 4.8 和 Fable 5 的官方能力比較嗎?

不行。這是一位開發者 YouTuber 的單次、一次成形實測,不是可重複驗證的標準跑分。它的價值在於呈現一個貼近真實使用場景的案例,但同一組指令換個時間或換個人跑,結果可能不同,不應被當作模型能力的最終定論。

Q2:為什麼 Fable 5 用的 Token 比較少,帳單卻比較貴?

因為實際成本是「用量 × 單價」的結果。Fable 5 在這場實測中用更少的輸出 Token 完成任務(用量端更有效率),但若它的每 Token 單價較高,只要單價漲幅超過用量降幅,總成本還是會比較高。省 Token 和省錢是兩件要分開看的事。

Q3:影片裡那些美元成本數字是官方定價嗎?

不是。那些數字是作者用自己做的用量追蹤器,依「假設採用量計費」換算出來的估計值,用來對比兩個模型的相對成本差距,不代表 Anthropic 的官方定價。實際費用請以官方公告與帳單為準。

Q4:Fable 5 真的會轉成用量計費嗎?

影片中作者提到 Fable 5 預計在數週後轉為用量計費,但這是他影片當時(2026 年 6 月)的說法,非官方正式定價公告。實際的計費方式與時程,一律以 Anthropic 官方公告為準。

Q5:我該怎麼決定要用哪個模型?

沒有絕對答案,取決於你的任務。複雜、需要高完成度、失敗重來成本高的任務,能力較強的模型即使單價較貴也可能更划算;結構單純的任務則未必需要動用最貴的旗艦模型。建議先建立自己的 Token 用量追蹤,用實際數據而不是體感來做選型與預算決策。

資料來源聲明

本文內容參考整理自 YouTube 頻道 Pat Simmons 於 2026 年 6 月 11 日發布的影片《I Made Opus 4.8 and Fable 5 Build the Same App (RAW RESULTS)》,文中所有實測結果、Token 用量與成本數字均為該影片作者之單次實測記錄與換算估計,非官方跑分或官方定價,也非逐字翻譯,為重新組織與論述後的整理。

延伸閱讀

立即行動

與其憑體感猜哪個模型比較划算,不如用實際數據來決定。如果你的團隊正在多個大型語言模型之間做選型、或想搞清楚自己的 Token 用量到底花在哪、換算成本又是多少,免費試用 AI Token King,讓我們幫你把不同模型的用量與成本一次攤開來看,把選型和預算決策建立在真實數字上,而不是行銷話術上。

最新文章

查看全部
DeepSeek V4.1-Flash 上線:官方定價不漲反降,V4-Pro 將被悄悄取代,帳單怎麼跟著變?

DeepSeek 已於 2026 年 9 月 10 日 04:00 UTC 正式推出新一代模型 V4.1-Flash,同步生效的新定價不是漲價,而是比一個月前才調整過的 V4-Flash 價格再往下降:輸出 token 便宜約 9%,快取未命中(cache-miss)輸入 token 便宜約 32%。更關鍵的是,DeepSeek 官方已經宣布從 9 月 14 日中午(北京時間)起,所有打到 dee

 
 
 
SpaceXAI(原xAI)Grok 4.6 API 官方定價全解析:輸出價每M僅$6,比 Claude、GPT-6 便宜多少?

Grok 4.6 的 API 定價是短內容(低於20萬token)輸入每百萬token 2美元、輸出6美元,超過20萬token的長內容則整段請求改按輸入4美元、輸出12美元計費;如果你只看輸出token的價格,Grok 4.6 比 Claude Fable 5.1、GPT-6 Astra 便宜超過八成,是目前主流旗艦模型裡數一數二便宜的選擇。你可能也發現,現在查詢這些資料時,官方文件網域已經不叫

 
 
 
GLM-5.3、Kimi K3 官方定價曝光:除了 DeepSeek,這兩款中國大模型你也該認識

如果你對中國大模型的認識還停留在「DeepSeek 很便宜」,那你可能漏掉了兩個這半年陸續上線、定價同樣壓得很低的競爭者:Zhipu(智譜)旗下的 GLM-5.3,以及 Moonshot AI 的 Kimi K3。GLM-5.3 官方標準定價是每百萬 token 輸入 1.4 美元、輸出 4.4 美元,其中鎖定輕量任務的 GLM-5.3-Flash 目前還在五折優惠期,但優惠將在今天(2026 年

 
 
 

留言


bottom of page