Gemini API 定價全解析:3.6 Flash、3.1 Pro、Flash-Lite 該怎麼選最省?
如果你正在評估 Google Gemini API 的成本,先講結論:Gemini 沒有單一價格,你至少要同時決定「哪個模型」和「哪一種計費模式」——同一顆模型在 Standard(標準)、Batch(批次,五折)、Flex(彈性,同批次價)、Priority(優先,約 1.8 倍價)之間,價差可以到 3 倍以上;而 Gemini 3.1 Pro 這種旗艦模型,光是 prompt 超過 20 萬 token,輸入輸出價格就會直接跳一倍。這篇文章會把 Google 官方定價頁上的數字逐一攤開,讓你知道自己在為哪一種「快慢與規模」付錢。
Gemini API 的四種計費模式:Standard、Batch、Flex、Priority 差在哪
Google 官方定價頁把每一顆 Gemini 模型都拆成最多四種計費模式,這是理解 Gemini 成本結構的第一步:Standard 是預設的即時呼叫模式,也是大多數人第一次串接 API 時看到的價格。Batch 則是非即時處理,官方文件明確標示「Batch API(50% cost reduction)」,也就是不管哪顆模型,只要能接受非即時回覆、把請求整批送出去等待處理,價格就直接砍半。Flex 在官方定價表上的數字目前與 Batch 完全相同,但定位是「彈性」而非「批次」,代表你不需要真的把請求包成一個批次工作,而是接受系統可能延後處理以換取跟 Batch 一樣的價格。Priority 則是反過來,用大約 1.8 倍於 Standard 的價格,換取更高的處理優先權,適合你不能等、也不想因為系統忙碌被排隊的場景。
換句話說,同一顆模型、同一個任務,你光靠選對計費模式,就可能讓成本差到 3.6 倍(Priority 對比 Batch)。這也是為什麼看 Gemini 定價,不能只看「模型名稱後面那個數字」,而要先確認自己的任務能不能接受非即時回覆。
Gemini 3.6 Flash:目前的主力模型要花多少錢
Gemini 3.6 Flash 是官方定價頁上定位為「最智慧的速度型模型,結合前沿智慧與更強的搜尋和 grounding 能力」的主力模型。Standard 模式下,每 100 萬 token 的輸入價格是 1.5 美元,輸出價格(含 thinking token)是 7.5 美元。如果你的任務可以排入 Batch,價格會降到輸入 0.75 美元、輸出 3.75 美元,剛好是 Standard 的一半,印證了前面提到的「Batch 一律五折」規則。Flex 模式的價格跟 Batch 完全相同。如果你需要 Priority 的優先處理,價格會上升到輸入 2.7 美元、輸出 13.5 美元。
值得注意的是輸出價格已經「含 thinking token」——也就是模型內部推理過程消耗的 token 也算在輸出計費裡,這點跟很多人以為的「只有看得到的回答才算錢」不一樣,如果你的應用大量觸發模型的推理鏈,實際帳單可能比你只算「回答字數」估出來的數字更高。
Gemini 3.1 Pro:為什麼超過 20 萬 token 價格會直接翻倍
如果你要處理長文件、長對話或大型程式碼庫分析,很可能會用到 Gemini 3.1 Pro Preview,官方將它定位為「多模態理解、agentic 能力與 vibe-coding 領域最好的模型家族」。這顆模型的定價結構比 Flash 系列更複雜,因為官方直接用 20 萬 token 這個門檻切成兩段收費:Standard 模式下,prompt 在 20 萬 token 以內,輸入是每百萬 token 2 美元、輸出 12 美元;一旦 prompt 超過 20 萬 token,輸入直接變成 4 美元、輸出變成 18 美元——輸入價格剛好翻倍,輸出價格則上升 50%。
這代表如果你的應用場景經常會餵入超長上下文(例如整份合約、整個程式碼庫),實際平均成本會比你只看「起始價 2 美元/12 美元」估出來的數字高不少,長 prompt 的佔比越高,帳單被拉高的幅度也越明顯。Batch 模式下這兩段門檻依然存在,只是價格砍半(20 萬以內輸入 1 美元、輸出 6 美元;超過則是輸入 2 美元、輸出 9 美元),Priority 模式則是 20 萬以內輸入 3.6 美元、輸出 21.6 美元,超過門檻後輸入 7.2 美元、輸出 32.4 美元。
Context Caching:重複餵給模型的內容怎麼算比較便宜
如果你的應用會重複把同一段內容(例如系統提示詞、產品說明書、長篇背景資料)餵給模型,Google 官方提供 Context Caching(上下文快取)機制來降低重複計費的成本。以 Gemini 3.6 Flash 為例,Standard 模式下的快取內容價格是每百萬 token 0.15 美元,遠低於同模式下 1.5 美元的一般輸入價,等於是把重複內容的計費打了一折;此外快取內容還會額外收取每小時每百萬 token 1 美元的儲存費,這筆儲存費是獨立於「快取讀取價格」之外的另一筆帳,長時間保留大量快取內容時需要一併估算。Gemini 3.1 Pro 的快取價格則是依前面提到的 20 萬 token 門檻分段計價(20 萬以內 0.2 美元、超過則 0.4 美元),儲存費為每小時每百萬 token 4.5 美元。
值得留意的是,官方定價頁也註明「免費層(Free tier)」的使用內容會被用於改善 Google 產品,只有升級到付費層(Paid),你的內容才不會被用來訓練模型——這是選擇免費層或付費層時,除了額度之外另一個實質差異。
Grounding with Google Search:接上即時搜尋要另外付費
Gemini 3.x 系列模型支援「Grounding with Google Search」,讓模型的回答可以連結到即時的網路搜尋結果,這對需要回答時事、股價、新聞這類會隨時間變動資訊的應用很關鍵。但官方定價頁明確指出,這項功能不是無限使用:每月有 5,000 次免費搜尋請求額度(這個額度是「共用」的,橫跨你所有 Gemini 3.x 模型的呼叫加總計算,不是每顆模型各自 5,000 次),超過之後每 1,000 次請求收費 14 美元。官方也特別註明,一次使用者的請求,模型內部可能會觸發不只一次 Google 搜尋查詢,而每一次內部查詢都會被計費,所以你在應用層看到的「一次提問」,實際扣費次數可能不只一次。Grounding with Google Maps 走的是同一套邏輯與費率。
Flash-Lite 系列:高流量、低單價場景的選擇
如果你的應用是大量、簡單的分類、翻譯、資料清洗這類高流量但單次任務不複雜的工作,Gemini 3.1 Flash-Lite 是官方定價頁上價格最低的正式(非預覽)模型之一:Standard 模式輸入價格是每百萬 token 0.25 美元(文字/圖片/影片,音訊則是 0.5 美元),輸出價格是 1.5 美元;Batch 模式再打五折,輸入 0.125 美元、輸出 0.75 美元。以「輸入+輸出各 100 萬 token」的假設情境概算,Flash-Lite 的 Batch 價格組合(約 0.875 美元)只有 Gemini 3.1 Pro 同樣情境 Batch 價格組合(20 萬 token 以內約 7 美元)的一小部分,兩者價差超過 7 倍,這也說明為什麼企業在做模型選型時,通常會把「高流量但簡單」和「低流量但複雜」的任務拆開,分別對應不同價格帶的模型,而不是所有任務都丟給同一顆旗艦模型處理。
Gemini 跟 Claude、GPT 比,算貴還是便宜
單看數字,Gemini 3.6 Flash 的 Standard 定價(輸入 1.5 美元、輸出 7.5 美元)落在市場上主流「中階、速度優先」模型的價格帶;Gemini 3.1 Pro 的起始價(20 萬 token 以內輸入 2 美元、輸出 12 美元)則接近旗艦模型的中低價位。這篇文章不重複列出 Anthropic、OpenAI 官方當下的完整價格表——如果你想看 Claude、GPT、Gemini 三家的完整定價對照,可以參考本站另一篇《Claude、GPT、Gemini 2026年最新API定價全解析》。但有一個跨廠共通的規律值得先記住:Batch(批次、非即時)模式打五折,這件事在 Anthropic 的 Batch API、以及 Gemini 的 Batch 模式上都是一致的設計,代表「你的任務能不能接受非即時回覆」這個問題,本身就值一半的帳單。
企業實務上該怎麼選:先分工作負載,再選計費模式
把前面幾段內容串起來,實務上可以用兩個問題快速判斷該用哪個組合:第一,這個任務需要即時回覆,還是可以延後處理?如果可以延後,先確認能不能改用 Batch 或 Flex,直接省一半。第二,這個任務的輸入內容有多少比例是重複的(例如固定的系統提示詞、產品手冊)?如果重複比例高,Context Caching 幾乎是必用的成本控管工具,尤其是在 Gemini 3.1 Pro 這種本身單價就比較高的模型上,快取帶來的節省會更明顯。至於模型選擇,高流量、任務單純的場景交給 Flash-Lite,一般日常任務用 Flash 系列打底,真正需要長上下文、複雜推理或 vibe-coding 能力的場景,才讓 Gemini 3.1 Pro 上場,並且盡量把 prompt 控制在 20 萬 token 以內,避免觸發翻倍計費的門檻。
常見問題(FAQ)
Q1:Gemini API 的免費層可以直接用在正式產品上嗎?
官方定價頁把免費層定位為「給開發者與小型專案入門使用」,且明確註明免費層的內容會被用於改善 Google 的產品。如果你的正式產品有資料隱私考量,或需要更高的速率限制與批次折扣,官方建議升級到付費層,付費層的內容不會被用來訓練模型。
Q2:Batch 和 Flex 的價格看起來一樣,選哪個比較好?
以 Gemini 3.6 Flash 為例,官方定價表上 Batch 與 Flex 的每百萬 token 價格確實相同(輸入 0.75 美元、輸出 3.75 美元)。差異主要在使用方式上:Batch 是把請求整批送出等待非即時處理的既有 API 型態;Flex 則是另一種計費層級選項。實際串接時建議直接參考官方 API 文件確認兩者在請求格式與服務等級上的技術差異,而不是只看價格挑選。
Q3:Context Caching 的儲存費用會不會讓成本反而變高?
有可能,這是很多人容易忽略的地方。快取讀取價格雖然只有標準輸入價的一折左右,但只要快取內容還保留著,就會依每小時每百萬 token 計算儲存費(例如 Gemini 3.6 Flash 是每小時每百萬 token 1 美元)。如果你快取的內容很少被重複呼叫,卻長時間保留不清除,儲存費可能會侵蝕掉快取省下的讀取費用差額,建議依實際重複呼叫頻率設定快取的存活時間。
Q4:Gemini 3.1 Pro 的「20 萬 token」門檻,是輸入和輸出分開算嗎?
官方定價頁是以 prompt(輸入)的 token 數是否超過 20 萬來決定輸入和輸出各自適用哪一段價格,也就是「輸入內容的長度」決定了這次呼叫落在哪個價格區間,而不是輸出的長度。這代表即使你只要求模型輸出很短的回答,只要輸入的內容(例如整份長文件)超過 20 萬 token,輸入和輸出價格都會一起跳到較高的那一段。
Q5:Grounding with Google Search 的免費額度是每個模型各有 5,000 次嗎?
不是。官方定價頁明確寫明這 5,000 次免費搜尋請求,是「所有 Gemini 3.x 模型共用」的每月額度,不是每顆模型各自獨立擁有。如果你同時用好幾顆 Gemini 3.x 模型串接 grounding 功能,實際上是在瓜分同一個 5,000 次的額度池,需要用量高的團隊要特別注意這一點,避免估算時重複計算免費額度。
資料來源聲明
本文所有 Gemini API 定價數字,皆逐項查證自 Google 官方文件 Gemini Developer API pricing(ai.google.dev/gemini-api/docs/pricing,查證日期:2026-08-06),包含 Gemini 3.6 Flash、Gemini 3.5 Flash、Gemini 3.1 Flash-Lite、Gemini 3.1 Pro Preview 在 Standard、Batch、Flex、Priority 四種計費模式下的輸入/輸出/快取價格,以及 Grounding with Google Search/Maps 的免費額度與超額計費規則,均直接擷取自官方頁面原始內容,未使用訓練記憶中的舊數字。跨廠比較部分僅引用本站既有文章、未重新查證 Anthropic/OpenAI 當下即時定價,如需最新對照請另行查證。
延伸閱讀
如果你正在評估企業要用哪個 AI Token 方案,或想找更省成本的串接與管理方式,免費試用 AITokenKing,直接比較不同模型與計費模式的實際花費。

留言