Opus 4.8 vs Fable 5 實測:同一個 App、同一組指令,兩大模型的能力與 Token 成本差多少
最近有一支在 YouTube 上累積近 90 萬觀看的實測影片,做了一件很多人想看卻很少人認真做的事:把完全相同的指令同時丟給 Anthropic 的 Opus 4.8 和新旗艦模型 Fable 5,各自一次成形、不做任何修改、直接部署上線,然後正面對比。更難得的是,作者還自己做了一個用量追蹤器,把每一次生成的輸入 Token、輸出 Token、以及換算成本都攤出來看。這篇文章會幫你把這場實測的重點整理清楚——不只是「誰做得比較漂亮」,而是對正在選模型、抓 Token 預算的人真正有用的那部分:能力差距與成本差距,其實是兩條不一樣的線。
先講一個前提,避免你把這篇當成官方評測:以下所有數字與結果,都來自這位開發者(頻道 Pat Simmons)的單次、一次成形(one-shot)實測,不是可重複驗證的標準跑分。同一組指令換個時間、換個人跑,結果可能不同。所以請把它當成「一個貼近真實使用場景的案例」,而不是「模型能力的最終定論」。
這場實測是怎麼設計的?
作者給兩個模型的規則完全一樣,這是整場對比可信度的基礎:
同一組指令:兩邊拿到逐字一模一樣的提示詞
一次成形(one-shot):只給一次輸出機會,不做反覆修改、不回頭補救
直接上線:生成結果實際部署到網路上,用真實可操作的成品來評斷,不是看截圖
在這個規則下,作者連續做了三個難度遞增的專案:一個完整的電商網站、一個可互動的 3D 藝術史美術館、以及一個《世紀帝國》風格的即時戰略遊戲。三個專案分別考驗不同的能力——前端設計、資料庫架構、外部 API 串接、以及最難的 3D 世界即時渲染。
三場實測,結果一面倒
第一場:電商網站。 兩個模型都被要求做一個虛構蠟燭品牌的完整電商站,包含 30 個各自不同的商品、landing page、資料庫。Opus 4.8 的成品是可用的——文字清楚可讀、商品有標籤(比作者先前用其他工作流測試時好),但有些細節不夠細膩,像是版位配色、按鈕設計、分類篩選略顯雜亂。Fable 5 則在同樣的指令下,做出明顯更乾淨的介面:更好的按鈕、漸層背景、更貼近真實電商的通知列,甚至在「如何提示圖片生成模型」這件作者完全沒教的事情上,Fable 5 自己就把商品情境照的美感處理得更好。
第二場:3D 藝術史美術館。 這是作者說「試了好幾年、沒有一個模型做到過」的專案:一個可縮放的藝術史時間軸,點進某位藝術家能看到他的介紹,再進到一個 3D 畫廊實際「走」進去看畫,所有畫作資料從維基媒體 API 抓取。結果Fable 5 不只完成了,還做出可以用滑鼠在畫廊裡走動、觀看近千幅畫作的沉浸式體驗,過程中自己主動抓出資料錯誤(例如某位藝術家的維基條目命名帶括號導致分類錯誤)並修正。Opus 4.8 的時間軸視覺做得不錯,但關鍵的畫廊互動點不進去——畫布的拖曳操作蓋掉了點擊事件,等於最核心的功能是壞的。
第三場:《世紀帝國》風格遊戲。 難度最高的一場,要做一個瀏覽器裡可玩的 3D 即時戰略遊戲。Opus 4.8 的成品作者判定基本無法操作——單位像色塊、畫面無法移動、蓋不了建築。Fable 5 則做出一個地圖可導航、單位有盔甲細節、畫面接近真實遊戲水準、實際可玩的版本。
三場下來,作者的結論是 Fable 5 明顯勝出。但真正值得評估預算的人細看的,是下一段的成本數字。
關鍵的成本數據:Fable 5 更省 Token,但總價反而更貴
這是整支影片對「抓 Token 預算」的人最有價值的部分。作者的用量追蹤器記錄了兩個模型在各專案的實際 Token 消耗與換算成本(以下數字為作者影片中的實測記錄,成本為其依「若採用量計費」假設換算的估計值,非官方定價):
電商站:Opus 4.8 約 198,000 個輸出 Token、估計約 21 美元;Fable 5 約 188,000 個輸出 Token、估計約 37 美元
3D 美術館:Opus 4.8 輸入約 51,000、輸出約 437,000 Token、估計約 46 美元;Fable 5 輸入約 54,000、輸出約 280,000 Token,換算下來約貴 37%
看出弔詭的地方了嗎?在 3D 美術館這場,Fable 5 用的輸出 Token 明顯比 Opus 4.8 少(280,000 對 437,000),也就是它「更省 Token」;但最終換算成本卻更貴約 37%。這不是矛盾,而是揭示了一件評估成本時很容易搞混的事。
「更省 Token」跟「更便宜」是兩件不一樣的事
一個模型的實際帳單,是用量 × 單價兩個變數相乘的結果。Fable 5 在這場實測裡展現的是「用更少的 Token 完成更複雜的任務」——這是用量端的效率;但如果它的每 Token 單價比 Opus 4.8 高,那麼即使用量下降,只要單價漲幅超過用量降幅,總帳單還是會往上走。這正是這場實測出現「更省 Token 卻更貴」的原因。
對正在做模型選型或預算規劃的團隊,這帶出一個很實務的判斷點:不要只看「哪個模型比較省 Token」就下結論,也不要只看單價。真正決定帳單的是兩者相乘後的結果,而且會隨你的任務類型(簡單問答 vs. 複雜的多步驟 agent 工作)大幅浮動。作者也提到,他訂閱的是固定額度的訂閱方案(Max 20X),光是在同一場專案裡同時讓兩個模型一起跑,30 分鐘就燒掉了他當月約 40% 的用量額度——這也再次印證了 AI Coding Agent 的 Token 消耗會非線性放大這件事。
這對正在選模型、抓預算的人代表什麼
把這場實測的觀察收斂成幾個可以直接用的判斷點:
能力差距明顯時,貴一點可能是划算的:如果 Fable 5 能一次做到 Opus 4.8 做不到的成品(例如可互動的 3D 畫廊、可玩的遊戲),那麼多付約 37% 換一次成功、不用來回修改的時間,對某些任務可能反而省成本。成本不能只算帳單,也要算「失敗重來」的隱形成本。
簡單任務未必要用最貴的模型:反過來說,如果你的任務是結構單純、不需要複雜架構的工作,能力較低但單價可能較低的模型或許就夠用,把旗艦模型留給真正需要的複雜任務。
計費模式即將改變時,要提早留意:影片中提到 Fable 5 預計在數週後轉為用量計費(usage-based pricing)——這是作者影片當時(2026 年 6 月)的說法,實際計費方式與時程請以 Anthropic 官方公告為準。但背後的提醒值得記住:訂閱制與用量制的成本結構完全不同,切換之後你的實際花費可能與現在的體感差很多。
建立你自己的用量追蹤機制:這位作者做對的一件事,就是他自己做了一個 Token 用量追蹤器,才能把「更省 Token」和「更貴」這兩件事拆開來看。與其等帳單來才驚訝,不如提早把用量與成本攤在眼前。
FAQ
Q1:這場實測的結果,可以當成 Opus 4.8 和 Fable 5 的官方能力比較嗎?
不行。這是一位開發者 YouTuber 的單次、一次成形實測,不是可重複驗證的標準跑分。它的價值在於呈現一個貼近真實使用場景的案例,但同一組指令換個時間或換個人跑,結果可能不同,不應被當作模型能力的最終定論。
Q2:為什麼 Fable 5 用的 Token 比較少,帳單卻比較貴?
因為實際成本是「用量 × 單價」的結果。Fable 5 在這場實測中用更少的輸出 Token 完成任務(用量端更有效率),但若它的每 Token 單價較高,只要單價漲幅超過用量降幅,總成本還是會比較高。省 Token 和省錢是兩件要分開看的事。
Q3:影片裡那些美元成本數字是官方定價嗎?
不是。那些數字是作者用自己做的用量追蹤器,依「假設採用量計費」換算出來的估計值,用來對比兩個模型的相對成本差距,不代表 Anthropic 的官方定價。實際費用請以官方公告與帳單為準。
Q4:Fable 5 真的會轉成用量計費嗎?
影片中作者提到 Fable 5 預計在數週後轉為用量計費,但這是他影片當時(2026 年 6 月)的說法,非官方正式定價公告。實際的計費方式與時程,一律以 Anthropic 官方公告為準。
Q5:我該怎麼決定要用哪個模型?
沒有絕對答案,取決於你的任務。複雜、需要高完成度、失敗重來成本高的任務,能力較強的模型即使單價較貴也可能更划算;結構單純的任務則未必需要動用最貴的旗艦模型。建議先建立自己的 Token 用量追蹤,用實際數據而不是體感來做選型與預算決策。
資料來源聲明
本文內容參考整理自 YouTube 頻道 Pat Simmons 於 2026 年 6 月 11 日發布的影片《I Made Opus 4.8 and Fable 5 Build the Same App (RAW RESULTS)》,文中所有實測結果、Token 用量與成本數字均為該影片作者之單次實測記錄與換算估計,非官方跑分或官方定價,也非逐字翻譯,為重新組織與論述後的整理。
延伸閱讀
立即行動
與其憑體感猜哪個模型比較划算,不如用實際數據來決定。如果你的團隊正在多個大型語言模型之間做選型、或想搞清楚自己的 Token 用量到底花在哪、換算成本又是多少,免費試用 AI Token King,讓我們幫你把不同模型的用量與成本一次攤開來看,把選型和預算決策建立在真實數字上,而不是行銷話術上。

留言