top of page

阿仁的 Claude Code 半夜卡在用量上限,他才發現自己一直在幫舊對話付第二次錢

8月10日
讀畢需時 7 分鐘
Claude Code 用量上限與重複輸入成本示意圖

(以下情境為示意性虛構案例,主角「阿仁」為說明用示意人物,非真實客戶)

晚上十一點,阿仁盯著螢幕上那行紅字:「已達使用上限,請於 5 小時後再試」。

他是一間接案團隊的技術負責人,正在用 Claude Code 除一個上線前的關鍵 bug。他數了數,這輪對話他總共才打了不到二十句話,沒做什麼誇張的事,怎麼就被擋下來了?他把視窗切回瀏覽器,開始查「Claude 用量上限 為什麼這麼快」。

一個工程師一天燒掉 37.7 億 Token,卻沒打半個字

搜尋結果第一條,是 AI 領域一位固定產出教學內容的自媒體創作者 Nate B. Jones 的說法:他在自己 Codex 工作環境裡的一個工作天,追蹤器記錄下 37.7 億個 token 流動過去,其中 35.9 億是「重複輸入(reused input)」——將近 96%。他自認已經算是很拚的重度使用者,那天總共開了 143 個獨立對話串。但即使這樣,他也承認:他沒有打 37.7 億個字,任何人都不可能打那麼多。

阿仁盯著這段話愣住了。如果連重度使用者自己打的字都只是零頭,那消失的那 96% 到底跑去哪了?

每一句話都在幫前面九句話重新結一次帳

答案藏在 LLM 對話「假裝有記憶」的方式裡:每次按下 Enter,整段對話歷史都會被重新打包、從頭送一次。第一句話的成本就是你打的字,很單純。但第二句話的成本,是你打的字,加上上一輪的回答,加上你原本打的字。到了第十句,成本是這句話本身,加上前面九輪你早就付過錢的內容。等到第三十句,你這次真正打的東西,只是帳單上一個小到可以忽略的零頭——那些舊材料,就是「重複輸入」。

而且沒有人會主動幫你修好這件事。模型廠商不會,因為某種程度上,讓用戶大量使用正是他們的誘因所在;真的撞到算力天花板,他們才會反過來收緊限制。換句話說:怎麼把廠商給的額度用得更聰明,責任在使用者自己身上,不會有人自動幫你解決。

阿仁想起自己這幾週的習慣:一個對話串從早開到晚,中間夾雜了三、四個完全不相關的任務,捨不得開新對話,總覺得「反正都聊到這裡了」。他開始意識到,這種捨不得,可能正是那 96% 的來源之一。

他一項一項對照自己的用法,抓到了三個最燒錢的壞習慣

Nate B. Jones 把省 token 的做法分成三個層次,阿仁決定先從最基本、不用裝任何東西的「第一層」開始,對照自己的用法一項一項檢查。

第一個抓到的壞習慣,是捨不得換新對話。他習慣在同一個對話串裡處理完一個任務又接著問下一個完全不相關的問題,覺得「反正 AI 已經有上下文了,換新的還要重講一次」。但實際情況正好相反:任務一換,就該開新對話——這是 Nate 測試下來影響最大的一項改變。因為一個進行中的對話串,會拖著前面所有輪次的重複輸入一起往前送,可能是五萬、十萬,甚至上百萬 token 的舊包袱,而新任務根本用不到大部分內容。

第二個壞習慣,是把整個推理過程都往下一步硬塞。阿仁常常做完一輪研究、拿到一份報告,就把整段對話原封不動複製到下一個任務裡,心想「資料齊全比較保險」。但 Nate 的做法是:只帶走你真正要用的那個結果,不要連同過程、被打回票的草稿、模型的推理過程一起搬過去。一份研究報告可能扛著上百萬 token 的無關內容,其中大半是為了得出這份報告而繞的路,下一步根本用不到。

第三個壞習慣最容易被忽略:他常常把整份 PDF 或十幾張截圖一次丟給模型,讓它自己去讀、自己去找重點,覺得這樣比較「省事」。但讓模型自己去搜尋一份大檔案,是最燒 token 的做法之一——與其把整份原始檔案丟過去,不如自己先看過、抓出重點段落,或者把 PDF 轉成純文字再貼上去,只送「有用的最輕量版本」。這件事模型雖然做得到,代價卻是隱形的:畫面上看不到差別,帳單上會有感。

轉折:真正的天花板,不是他打了多少字,是廠商設定裡藏著看不見的固定成本

阿仁本來以為,只要管好自己怎麼打字、怎麼分段問問題就夠了。直到他讀到 Anthropic 自己公開的一項數據才發現,問題比想像中更底層:一個接了 GitHub、Slack、Sentry、Grafana 等幾個常見服務的典型設定,光是把這些工具的「說明書」(每個工具能做什麼、什麼時候該用、要帶哪些參數)塞進模型的上下文,在模型還沒開始做任何事之前,就已經燒掉大約 5.5 萬個 token。

換句話說,帳單上有一大塊錢,根本不是他打字或模型回答造成的,而是他「順手接上」的工具越多,模型光是「認識這些工具」就要先付一筆固定成本——而且每一輪對話都要重付一次。阿仁這才想起,他的 Claude Code 環境裡掛了七、八個 MCP 工具,其中至少一半這個專案根本用不到。

Nate 也提到目前業界正在補的兩個機制:OpenAI 支援的「壓縮(compaction)」會把長任務的進度濃縮保留,讓後續輪次不用重送全部細節;Anthropic 的「上下文編輯」則會在下一次請求前清掉舊的工具結果與思考過程。這些機制能幫上忙,但終究是「近似版本」,不是完美保留全部脈絡——阿仁的理解是:與其完全依賴廠商幫他清理,不如先養成不要一開始就把桌面堆滿的習慣。

結尾:他開始只掛當下任務用得到的工具,換一個乾淨的桌面重新開始

那天晚上,阿仁沒有真的等滿 5 個小時。他關掉那個開了一整天、夾雜好幾個任務的對話串,重新開一個乾淨的視窗,只針對眼前這個 bug 描述問題;他也把專案裡用不到的 MCP 工具一個一個拔掉,只留下這次任務真的會用到的兩三個。

他心裡想的不再是「這次上限什麼時候解除」,而是「下一次開對話之前,我的桌面乾不乾淨」。這跟他過去對 AI 用量的想像不太一樣——他一直以為問題出在「AI 不夠聰明」或「額度太小氣」,直到看懂了那 96% 到底是什麼,才知道真正該盯的,一直是自己怎麼把每一輪對話收拾乾淨。

常見問題 FAQ

Q1:為什麼我沒有打很多字,AI 使用額度卻很快就用完?

因為 LLM 對話本身沒有真正的記憶機制,每次你送出新訊息,整段對話歷史都會被重新打包、完整送一次給模型,這部分稱為「重複輸入(reused input)」。對話輪數越多,重複輸入佔的比例就越高,你這次真正打的字反而只是其中一小部分,這也是為什麼看似沒打多少字,額度卻消耗得特別快。

Q2:什麼時候該開一個新對話,而不是繼續原本的對話串?

只要任務性質換了,就建議開新對話——例如你原本在除一個 bug,接下來要問一個完全不相關的問題。繼續沿用同一個對話串,會把前面所有輪次累積的內容一起往下帶,即使新任務用不到大部分內容,仍然要為它們付費。

Q3:接很多工具(MCP/外掛)會讓 AI 用量變貴嗎?

會。根據 Anthropic 公開的資料,一個接了數個常見工具伺服器(例如 GitHub、Slack、Sentry、Grafana)的典型設定,光是把每個工具的功能說明送進模型的上下文,在模型還沒開始做事之前,就可能消耗約 5.5 萬個 token。建議只掛當下任務真正用得到的工具,不要一次全部接上。

Q4:把整份 PDF 或截圖直接丟給 AI,跟自己先整理過再貼上去,有差嗎?

有差,而且差距不小。讓模型自己去讀、自己去搜尋一份完整檔案,是相對燒 token 的做法;如果能先自己找出重點段落,或把檔案轉成純文字再貼上去,只送出真正有用的內容,能明顯降低單次請求的成本,而且這個節省效果會在後續每一輪對話中重複發生。

Q5:這篇提到的「Token Saver」和「Ringer」是 AI Token King 的產品嗎?

不是。這兩者是原始影片作者 Nate B. Jones 自行開發、發布在其他平台的第三方工具,本文僅依原始影片內容整理說明其設計概念,不代表 AI Token King 或兌心科技的推薦、保證或背書,讀者若有興趣使用,請自行查證該工具的官方說明與條款。

資料來源聲明

本文參考整理自 YouTube 頻道 AI News & Strategy Daily|Nate B Jones 於 2026 年 7 月 29 日發布的影片《Paste This Into Claude, Never Hit a Token Limit Again》,並經重新組織與敘事改寫,非逐字翻譯:https://www.youtube.com/watch?v=Y8vAQ1FgNbM 。文中「阿仁」為說明用示意人物,非真實客戶案例。文中提及 Anthropic 公開資料(工具定義約消耗 5.5 萬 token)、OpenAI 的對話壓縮機制、Anthropic 的上下文編輯機制,均為原影片引用之公開資訊,本文未另行查證原始技術文件,讀者若需精確數字請以各家官方文件為準。文中提及之第三方工具(Token Saver、Ringer)僅為說明原影片內容,不構成本站推薦或保證。

延伸閱讀

想知道自己的 AI 用量,有多少是花在「重複輸入」上?

阿仁後來才知道,那天晚上卡住他的不是某一句話,而是一整天沒被清理過的對話桌面。免費試用 AI Token King,把每一次對話實際花在哪裡攤開來看,找出自己真正該清理的地方,而不是等額度用完才發現問題。

最新文章

查看全部
AGENTS.md 是什麼?一份給 AI 看的 README,為什麼 Codex、Claude Code、Copilot 都在用

AGENTS.md 是一個開放、極簡的 Markdown 檔案格式,作用是把「怎麼在這個專案裡正確工作」的細節——像是建置指令、測試指令、程式碼風格、PR 規範——集中寫在一個固定位置,讓 AI 程式碼代理(coding agent)在動手改程式碼之前,能自己讀到這些脈絡,而不需要你在每次對話裡重新交代一遍。它由 OpenAI 於 2025 年 8 月釋出,2025 年 12 月 9 日與 Ant

 
 
 
Agent Skills 是什麼?Claude 用資料夾教 AI 做事,現在已成 OpenAI、Google 都跟進的開放標準

Agent Skills(代理技能,以下簡稱 Skills)是 Anthropic 在 2025 年 10 月 16 日推出的一種打包 AI Agent 能力的方式:把「怎麼把一件事做好」的程序性知識、範例與可執行程式碼,整理成一個包含 SKILL.md 檔案的資料夾,讓 Claude 在真的需要用到時才自己去讀取、執行,不用每次對話都重新解釋一遍。2025 年 12 月 18 日,Anthrop

 
 
 
A2A 協定是什麼?AI Agent 之間怎麼「找到彼此、談合作」,跟 MCP 有什麼不同

A2A(Agent2Agent)協定,是一套讓不同公司、不同框架打造出來的 AI Agent,能夠互相找到彼此、公開聲明自己能做什麼、並且把工作安全委派給對方執行的開放通訊標準。它由 Google 在 2025 年 4 月發起,同年 6 月捐贈給 Linux Foundation,2026 年 3 月推出第一個正式穩定版 v1.0,並在 2026 年 8 月 27 日以「Growth Stage(

 
 
 

留言


bottom of page