top of page

AI Coding 的 Token 成本怎麼降?5 個實測有效的省錢技巧(以 Claude Fable 5 為例)

  • 7月14日
  • 讀畢需時 6 分鐘

用 AI Coding Agent 寫程式,最讓人有感的痛就是 Token 帳單——尤其當你用的是像 Claude Fable 5 這種旗艦模型,一個複雜任務跑下來,週用量額度很快就見底。好消息是,降低成本不一定要換掉好模型,而是有一整套「用同一顆模型、但用得更聰明」的方法。這篇文章整理了一位開發者 YouTuber 實測分享的 5 個省 Token 技巧,全部圍繞同一個核心:在不犧牲產出品質的前提下,把花在 Token 上的錢壓下來。

先講清楚前提,避免誤會:以下所有具體數字(例如「省 80%」「便宜 22%」「每個任務 $22 對 $3.76」)都來自這位作者(頻道 Chase AI)自己的實測與引用的 benchmark,不是官方保證的通用結果,你的實際任務類型不同,省下的比例也會不同。另外文中提到的模型方案變動(例如某模型的訂閱方案調整),一律以各家官方公告為準。把它當成「一套值得試的方法論」,而不是「保證數字」。

技巧一:調降「思考等級」(effort level)——最簡單、槓桿最高

這是作者認為 CP 值最高的一招。像 Claude Fable 5 這類模型預設跑在「高(high)」思考等級,有些人甚至開到「extra high」或「max」。但真相是:大部分任務根本不需要那麼高的思考等級。

作者引用一個長時程 agentic 任務的 benchmark:在 max 等級下,平均每個任務成本約 22 美元;但降到 low 等級,成本只剩約 3.76 美元——超過 80% 的降幅。而關鍵是,Fable 5 在 low 等級的通過率(約 60%)竟然還比 Opus 4.8 在 max 等級(約 59%)略高。換句話說,你用更低的成本、拿到不輸給對手旗艦模型全開的結果。他也引用 Anthropic 自己的「程式碼準確度 vs 成本」圖表佐證:Fable 5 在 low 等級的分數,跟 Opus 4.8 在 max 等級幾乎相同,但成本只有一半。

實務判斷:任務越單純(例如做網頁設計),越應該用 medium 甚至 low;只有真正複雜的任務才需要把等級拉高。光是這一個調整,通常就能明顯拉低你消耗週用量額度的速度(實際幅度仍會因任務而異)。作者的具體建議是:下次做任務時,先試試 medium 或 low,你很可能會對結果的品質感到意外。

技巧二:讓旗艦模型只當「架構師」,把執行工作外包給便宜模型

不要讓最貴的模型(Fable 5)同時包辦「規劃」和「執行」全部的事。讓它只負責出計畫(當架構師),然後依任務複雜度,把實際執行的工作分派給更便宜的模型——可能是 Opus、Sonnet,甚至是外部模型如 GPT 系列或本地模型。

作者提到,旗艦模型本身夠聰明,能在計畫裡明確標出「這部分用 Opus、那部分用 Sonnet、第三部分交給 OpenAI」,你也可以透過像 Codex plugin 這類工具串起來。如果覺得這樣太複雜,最簡單的做法是:讓 Fable 5 在「計畫模式(plan mode)」產出一份 markdown 計畫檔,然後另開一個 session 用 Opus 去執行這份計畫。重點是別讓最貴的模型把 Token 燒在低階、瑣碎的執行工作上

技巧三:引入專門「減少囉唆」的 skill,砍掉多餘 Token

旗艦模型有個特性是輸出偏冗長(verbose)。作者介紹了像 Ponytail、Caveman 這類第三方 skill,它們的原理是給模型一套指引,讓它用更精簡的方式寫出同樣有效的程式碼——輸出變少、消耗的 Token 就變少。

作者實測 Fable 5 搭配 Ponytail、在 medium 設定下,整體大約便宜了 22%(有趣的是還比該工具原本宣稱的數字更好)。他的觀點是:這是一顆貴的模型,只要外面有東西能給你 20% 的成本改善,就值得試——因為當總花費是幾千美元等級時,20% 是一筆可觀的錢。當然,這類第三方工具的效果會因模型與任務而異,導入前建議自己先小規模驗證。

技巧四:用便宜模型做「研究」,把整理好的資料交給旗艦模型規劃

這招表面上跟技巧二相反,但邏輯是互補的。很多計畫在動工前需要大量研究,而研究這件事不需要動用最高階的推理能力。作者的做法是:用較低階的模型(如 Opus、Sonnet)搭配深度研究工作流去蒐集、驗證網路上的最新資訊,再把整理好的脈絡交給 Fable 5 去做真正需要高階智力的「規劃」。

他舉例,自己做這支影片的研究時,深度研究工作流一口氣開了上百個子代理(sub-agent)——如果每一個子代理都用 Fable 5 跑,額度瞬間就爆了。讓便宜模型去做這種「大量但不需要頂級智力」的鋪墊工作,把旗艦模型的用量省下來給真正重要的環節,是很划算的分工。

技巧五:Advisor 模式——聰明模型當顧問,便宜模型當執行者

這是前面幾招的「進階整合版」。Advisor(顧問)模式的概念是:一個聰明的模型當顧問/規劃者,把計畫交給一個較便宜的模型當執行者去讀寫檔案、呼叫工具;一旦執行者卡住,就把當下狀況回報給顧問模型問「我卡住了,該怎麼辦?」。

作者提醒一個容易搞錯的操作細節:你當下設定的模型,就是「執行者」。所以如果你想讓 Fable 5 當顧問、讓 Opus 實際做事,你要先把模型設成 Opus,再用指令把顧問設成 Fable。要注意的是,作者也坦言 Anthropic 目前沒有官方公布用 Fable 5 當顧問的成效數字,這部分是他根據既有 Opus/Sonnet 組合的數據所做的合理推測,實際效果仍需自己驗證。

把這 5 招收斂成一個原則

如果要用一句話總結這 5 個技巧,那就是:別再讓一顆最貴的模型從頭到尾包辦所有事。 把工作依「需不需要頂級智力」拆開——高階規劃留給旗艦模型、低階執行與研究交給便宜模型,再加上調降思考等級、引入省 Token 的 skill,就有機會在不換掉好模型的前提下,把帳單明顯壓下來(實際能省多少,仍要看你的任務結構,導入後用自己的用量數據驗證最準)。

不過要能做到這種「分工」,前提是你得先看得懂自己的 Token 到底花在哪、哪個環節最燒錢。這也是為什麼讀懂用量儀表板與成本指標是省錢的第一步——沒有數據,你連該砍哪裡都不知道。

FAQ

Q1:調降思考等級(effort level)會不會讓產出品質變差?

會依任務複雜度而定。根據影片作者引用的 benchmark,在較單純的任務上,低思考等級的產出品質下降有限,卻能省下大量成本;只有真正複雜的長時程任務才明顯需要高等級。建議先在低風險任務上試 medium/low,比較結果再決定,不要一律開到最高。

Q2:影片裡「省 80%」「便宜 22%」這些數字,我照做也能拿到嗎?

不一定。那些是該 YouTuber(Chase AI)自己的實測與引用 benchmark 的結果,你的任務類型、程式碼庫、使用習慣都不同,實際省下的比例會不一樣。把它當成「值得驗證的方向」,導入後用自己的 Token 用量數據來確認實際效果。

Q3:讓旗艦模型當架構師、便宜模型當執行者,會不會很難設定?

可以很簡單也可以很進階。最簡單的版本是:讓旗艦模型在計畫模式產出一份 markdown 計畫,再另開 session 用便宜模型執行。進階版才需要串接多模型分派或 advisor 模式。建議從簡單版開始,熟悉後再往上疊。

Q4:第三方省 Token 的 skill(如 Ponytail、Caveman)可靠嗎?

效果會因模型與任務而異——影片作者實測 Fable 5 搭配後省了約 22%,但這不代表每個場景都有一樣的效果。這類工具的原理是讓模型輸出更精簡,值得小規模試用驗證,但不要直接把宣稱數字當成保證。

Q5:省 Token 最該先做的一件事是什麼?

先搞清楚自己的 Token 到底花在哪。所有分工與優化的前提,都是你得先看得懂用量與成本結構——哪個模型、哪個環節最燒錢。沒有這個基礎,任何省錢技巧都只是憑感覺。

資料來源聲明

本文內容參考整理自 YouTube 頻道 Chase AI 於 2026 年 7 月 3 日發布的影片《Make Fable 5 80% Cheaper (& Other Usage Cheat Codes)》,文中所有成本數字、省下比例與 benchmark 結果均為該影片作者之實測記錄或其引用之第三方數據,非官方保證的通用結果,也非逐字翻譯,為重新組織與論述後的整理。文中提及的模型方案變動、功能細節,一律以各家官方公告為準。

延伸閱讀

立即行動

省 Token 的第一步,是先看得懂自己的用量花在哪。如果你的團隊正在用 Claude、GPT 等模型做開發,卻對每個月的 Token 帳單一頭霧水,免費試用 AI Token King,讓我們幫你把不同模型、不同環節的用量與成本一次攤開來看——先看懂數據,才知道該從哪裡省。

最新文章

查看全部
軟體為什麼開始「按 Token 計價」?AI Agent 時代的採購邏輯與成本治理

如果你最近在評估 AI 工具,大概會發現一件事:越來越多產品不再用「一個帳號多少錢」來收費,而是改用 Token 計價。這不只是換個計費單位而已——它其實反映了 AI 時代軟體採購邏輯的一次根本轉變。企業軟體巨頭 Box 的高層在一段公開分享裡把這件事講得很清楚,這篇文章就用他的觀點當骨架,帶你看懂「按 Token 計價」背後的道理,以及它對你採購與控成本的實際影響。 先講清楚前提:本文的觀點主要

 
 
 
Claude、GPT、Gemini 2026年最新API定價全解析:誰才是真正便宜的選擇?

Claude、GPT、Gemini,這三家的 API 定價,2026 年中又洗了一輪牌。先講結論:如果只看「牌價數字」,Google Gemini 3.1 Flash-Lite 最便宜、OpenAI GPT-5.5 標售價最高;但如果你是重度使用者,真正決定帳單多寡的從來不是牌價本身,而是你有沒有用對快取、批次處理,以及你選的模型用的是哪一套 tokenizer。這篇把 Anthropic、Ope

 
 
 
AI Token 為什麼這麼貴?從「自迴歸」運作原理拆解 Coding Agent 燒錢的真相

如果你最近開始用 AI Coding Agent 寫程式,應該多少感覺到一件事:同樣是「跟 AI 對話」,用網頁版聊天機器人問問題很便宜,但把 AI 接進開發流程做自動修 bug、讀檔案、跑測試,帳單卻會不成比例地飆高。這不是你的用法特別浪費,而是語言模型計算 Token 成本的方式,天生就是這樣設計的。這篇文章會把「Token 為什麼貴」拆到最底層的運作原理,讓你在評估要不要導入 AI Codi

 
 
 

留言


bottom of page