top of page

Claude 的 Prompt Caching 什麼時候會讓你的 AI 帳單不降反升?

8月26日
讀畢需時 8 分鐘
Claude Prompt Caching 快取寫入與讀取示意圖

Prompt Caching(提示詞快取)是 AI 供應商提供的一種計價機制:把你重複送出的固定內容(例如系統提示詞、工具定義、專案背景說明)暫存起來,下次同樣內容再度出現時,只用便宜的「快取讀取」價格計費,不用全額的「輸入」價格計費。但快取本身也要花錢寫入,如果你的內容前綴不夠穩定、命中率不夠高,寫入成本可能比讀取省下的錢還多,結果整體帳單反而變貴。這正是 YouTube 頻道 Atef Ataya 在一次涵蓋 5 種上下文管理策略的系統性實測中,發現的其中一個反直覺結論。

這篇文章會拆解:快取實際上在省什麼、什麼條件下快取會失效變成負擔、以及在快取之外,還有哪些更根本的省錢順序值得你優先考慮。

Prompt Caching 到底在快取什麼?

多數 LLM API 把一次呼叫拆成「輸入 token」與「輸出 token」分開計價,而快取機制再把輸入端多切出兩種狀態:快取寫入(cache creation)快取讀取(cache read)。第一次送出某段固定內容時,系統要把它存進快取,這筆費用通常等於或高於一般輸入價格;之後只要同一段內容原封不動再次出現在請求最前面,系統就能直接命中快取,改用遠低於一般輸入價格的「讀取價」計費。

換句話說,快取省的不是「內容本身」,省的是「重複」。如果一段內容每次呼叫都長得不一樣,快取永遠命中不了,你等於白付了一次寫入成本卻拿不到任何折扣。

快取要放在哪裡才有效?穩定前綴 vs 任務資料

實測中特別強調一個排序原則:把穩定不變的內容放在請求最前面——像是系統規則、工具定義、專案或程式庫的固定說明——再把每次都會變動的任務資料放在後面。原因很直覺:快取是靠比對「前綴是否一字不差」來判斷命不命中的,只要前面有一個字元不同,後面即使內容一樣也救不回來。把容易變動的內容混在穩定內容前面,等於主動打斷快取鏈。

反過來,如果你的專案本身工具定義少、背景說明常常隨任務改寫,快取能抓住的「穩定前綴」就很短,這時開快取的效益天生就有限。

為什麼快取讀取量降了,帳單卻不降反升?

這是整篇實測最反直覺的部分。手動加上快取的那一組實驗中,「快取輸入」量確實下降了約 15%——聽起來應該省錢——但整體成本反而上升了約 7%。原因是:省下的讀取量,被快取讀取本身產生的額外開銷吃掉了。當快取命中率不夠穩定、前綴常常被打斷時,系統得不斷重新寫入快取、又持續產生讀取請求,這些零碎的讀取次數累積起來,抵銷甚至超過了原本該省下的部分。

這也解釋了為什麼快取不是「開了就一定划算」的功能,而是一個跟你的使用模式高度相關的定價問題:命中率夠高、前綴夠穩定,才值得付出寫入成本去換讀取折扣;命中率不夠,寫入成本就變成純粹的額外負擔。

快取的保存時間(TTL)該怎麼選?

多數提供 Prompt Caching 的 API,會讓使用者在「保存快取多久」上做選擇——保存時間越長,通常代表你要付出更高倍數的寫入成本,用來換取後續更長時間內都能命中折扣價。這本質上是一個風險交換:如果你確定接下來一小段時間內會頻繁重複呼叫同一份前綴,拉長保存時間划算;但如果呼叫頻率不夠高、前綴又可能中途變動,多付的寫入成本可能根本等不到足夠的命中次數回本。

⚠️ 需特別說明:影片中提到 Claude API 目前透過「快取寫入 token」與「快取讀取 token」兩個獨立欄位來揭露快取用量,並提供兩種保存時間分層供選擇(較短的一檔採標準快取價格、較長的一檔則按倍數計價)。這是原影片對快取機制運作方式的描述,具體的分層時長與費率倍數以 Anthropic 官方定價頁面當下公告為準,建議在實際評估是否開啟長保存時間前,直接對照官方最新定價文件確認數字,而非只依賴任何單一影片的說法。

比快取更早該做的一步:不是載入得更聰明,是一開始就別載入

實測比較了 5 種降低上下文成本的做法,結果排名第一、效果最大也最穩定的,不是任何形式的快取或更聰明的檢索技巧,而是最樸素的一招:在動手處理任務之前,先明確列出哪些檔案或資料「用得到」,其他一律不讀。這種做法讓需要送進模型的資料量大幅下降,換算下來整體成本比什麼都不做的基準情境低了三成左右,而且是所有測試組別中,唯一在每一輪重複測試都穩定省錢的做法。

背後的邏輯很簡單:快取、結構化索引之類的技巧,本質上是讓「載入」這件事變得更有效率,但模型還是要為載入進來的每一個 token 付錢;而先篩選、先排除不相關資料,等於有一部分 token 根本沒被送出去,這筆錢是真的沒付。最便宜的 token,是從一開始就沒被送進請求裡的那個。

「用到才載入」聽起來最合理,為什麼實測卻是最貴的策略?

另一種常見直覺是「一開始只帶最少的上下文,需要什麼再去抓,用完就丟」——聽起來像是最省資源的做法,但在這次實測中,它反而是成本最高的策略,比基準情境貴了將近四成五。

問題出在計費方式:多數 LLM API 是按整次請求計費,而且每次請求都要重新送出到目前為止累積的完整對話紀錄。「用完即丟」只是讓模型「忘記」某個檔案的內容,並不會讓這個檔案從帳單上消失;如果任務需要陸續查看數十個檔案,就等於進行數十次來回請求,而每一次來回都要重新夾帶前面所有的對話內容一起送出。原本設計用來「精簡」上下文的策略,最後反而變成上下文重複傳輸最多次的那一種。這也是整份實測裡被特別點名的一個提醒:上下文管理的優化方向,要看整次任務累積送出的 token 總量,而不是單次請求看起來乾不乾淨。

為什麼把所有省錢招式疊在一起用,反而比什麼都不做還貴?

把前面提到的多種上下文管理策略同時疊加使用,是許多操作指南預設會建議的做法,但實測結果顯示,全部疊加後的整體成本比什麼都不做的基準情境高了約兩成三——輸給了單獨使用其中任何一種做法。

原因在於:不同策略之間會互相打架而不是互相加分。例如同時做兩種不同角度的結構分析,會產生重複的分析開銷;而快取與「用到才載入」這兩種假設的使用模式本來就互相矛盾(一個假設前綴穩定重複、一個假設內容零碎多變),同時開啟只會讓額外設定成本疊加,卻沒有換到對應的節省。多做不等於更省,每種策略都有各自的啟動成本,疊加越多,需要克服的門檻也越高。

什麼情況下開快取才真的划算?一個判斷順序

綜合以上發現,可以整理出一個大致的優先順序,供評估自己的使用情境時參考:

1. 先做篩選,不是先做快取——動手前先明確界定「這次任務只需要哪些資料」,把不相關的部分直接排除在請求之外,這是效果最大且最穩定的一步。

2. 其次是給模型一份輕量的結構地圖——用一份精簡的目錄或依賴關係說明,讓模型不用靠反覆試探式讀取就能定位到需要的內容。

3. 快取放在架構決策之後,當成純粹的定價問題來看——先確認你的使用模式是否存在「穩定不變、會被重複呼叫」的前綴,如果有,才值得為它啟用快取;如果內容經常變動、呼叫頻率不高,開快取可能只是多付一筆寫入費。

4. 「用到才載入」的檢索式做法放最後——只有當候選資料量非常龐大、真正需要的部分只占極小比例時才考慮,否則按請求計費、重複夾帶對話紀錄的特性,很容易讓它變成最貴的選項。

這個順序的共同邏輯是:先解決「要不要送出這筆資料」,再解決「送出時能不能便宜一點」。快取解決的是後者,如果前者沒處理好,快取能發揮的空間本來就很有限。

FAQ

Q1:Prompt Caching 是什麼,跟一般的 API 呼叫計價有什麼不同?

一般計價只分「輸入」與「輸出」兩種 token;開啟快取後,輸入端會再拆出「快取寫入」與「快取讀取」兩種狀態,第一次出現的固定內容要付寫入費,之後原封不動重複出現時則以較低的讀取價計費。

Q2:開了 Prompt Caching,帳單一定會變便宜嗎?

不一定。如果送出的內容前綴不夠穩定、重複命中的次數不夠多,你付出的快取寫入成本可能超過讀取折扣省下的錢,實測中就出現過快取讀取量降低但整體成本反而上升的情況。

Q3:我的任務內容常常變動,適合開快取嗎?

如果任務資料每次都不同、沒有固定不變的前綴,快取幾乎抓不到穩定命中的機會,這種情境下開快取的效益通常有限,優先順序應該放在先篩選要用哪些資料,而不是急著開快取。

Q4:保存時間(TTL)該選短的還是長的?

取決於接下來重複呼叫同一份前綴的頻率夠不夠高。保存時間長通常代表寫入成本的倍數也更高,只有預期短時間內會密集重複命中,才值得用較高的寫入成本去換更長的折扣視窗;實際分層與倍數請以供應商官方定價頁面公告為準。

Q5:除了快取之外,還有哪些方法可以降低 AI Agent 的 token 成本?

實測顯示,在動手前先明確篩選「這次任務只需要哪些資料」是效果最大且最穩定的做法;其次是提供精簡的結構地圖幫助模型少走試探式讀取的彎路。這兩者都排在快取之前,因為它們減少的是「要不要送出」,快取只能優化「送出時貴不貴」。

Q6:這篇文章的測試數據是用 Claude 做的嗎?

原始實測是用另一家模型供應商(DeepSeek)公開的計價費率跑五輪重複測試,用來確保比較的是「不同上下文策略之間的成本比例」而非單一供應商的絕對金額;影片同時說明了 Claude API 快取機制的一般運作方式(快取寫入/讀取 token 與保存時間分層)。方法論的結論——快取效益取決於命中率與前綴穩定度、以及先篩選比先快取更重要——不限於特定供應商,但涉及 Claude 官方定價的具體數字,仍建議以 Anthropic 當下公告為準。

資料來源聲明

本文參考影片:《I Tested Claude's Prompt Cache. It Cost Me More.》,頻道 Atef Ataya,原始連結:https://www.youtube.com/watch?v=DyzDuiwISa8 。文中關於各項上下文管理策略的成本變化幅度(如快取、結構地圖、依賴關係圖、資料篩選、按需檢索等測試結果),均整理自該影片描述的實測方法與結論;影片實測採用另一家模型供應商公開費率作為統一比較基準,並說明比較的重點在於不同策略間的成本比例而非單一絕對金額。涉及 Claude API 快取機制運作細節(保存時間分層、費率倍數)之處,建議讀者另行查核 Anthropic 官方最新定價文件以取得當下準確數字。

延伸閱讀

想更精準地掌握你的 AI Token 成本?

不管是評估要不要開啟 Prompt Caching,還是想知道目前的 Agent 工作流每個月實際燒掉多少 Token,AI Token King 都能幫你把散落在不同模型供應商的用量與費用,整理成看得懂、能追蹤的儀表板。

最新文章

查看全部
DeepSeek V4.1-Flash 上線:官方定價不漲反降,V4-Pro 將被悄悄取代,帳單怎麼跟著變?

DeepSeek 已於 2026 年 9 月 10 日 04:00 UTC 正式推出新一代模型 V4.1-Flash,同步生效的新定價不是漲價,而是比一個月前才調整過的 V4-Flash 價格再往下降:輸出 token 便宜約 9%,快取未命中(cache-miss)輸入 token 便宜約 32%。更關鍵的是,DeepSeek 官方已經宣布從 9 月 14 日中午(北京時間)起,所有打到 dee

 
 
 
SpaceXAI(原xAI)Grok 4.6 API 官方定價全解析:輸出價每M僅$6,比 Claude、GPT-6 便宜多少?

Grok 4.6 的 API 定價是短內容(低於20萬token)輸入每百萬token 2美元、輸出6美元,超過20萬token的長內容則整段請求改按輸入4美元、輸出12美元計費;如果你只看輸出token的價格,Grok 4.6 比 Claude Fable 5.1、GPT-6 Astra 便宜超過八成,是目前主流旗艦模型裡數一數二便宜的選擇。你可能也發現,現在查詢這些資料時,官方文件網域已經不叫

 
 
 
GLM-5.3、Kimi K3 官方定價曝光:除了 DeepSeek,這兩款中國大模型你也該認識

如果你對中國大模型的認識還停留在「DeepSeek 很便宜」,那你可能漏掉了兩個這半年陸續上線、定價同樣壓得很低的競爭者:Zhipu(智譜)旗下的 GLM-5.3,以及 Moonshot AI 的 Kimi K3。GLM-5.3 官方標準定價是每百萬 token 輸入 1.4 美元、輸出 4.4 美元,其中鎖定輕量任務的 GLM-5.3-Flash 目前還在五折優惠期,但優惠將在今天(2026 年

 
 
 

留言


bottom of page