Claude Sonnet 5 是什麼?限時定價只到 8 月底,逼近 Opus 4.8 的「最會用工具」新一代

Anthropic 在 2026 年 6 月 30 日發布了 Claude Sonnet 5,官方形容它是「目前為止最能自主行動的 Sonnet 系列模型」——會自己規劃步驟、使用瀏覽器與終端機這類工具、以自主運作的程度完成任務,而這種程度的能力,幾個月前還得靠更大、更貴的模型才做得到。如果你正在看我們先前介紹過的 Fable 5、Opus 4.8 跟 Opus 5,這篇文章要幫你把「Sonnet 5 到底補上了什麼位置」講清楚——而且裡面有一個帶有明確時限的定價細節,值得你現在就注意。
Sonnet 5 補上的位置:agentic 能力大幅拉近跟 Opus 4.8 的差距
官方的說法很直接:對很多開發者來說,agentic AI(能自主規劃、執行任務的 AI)時代,其實就是從 Sonnet 系列的 Claude Sonnet 3.5、3.6、3.7 開始的,這幾個版本第一次讓大家看到 AI 在寫程式跟使用工具上的實力。但最近這段時間,agentic 能力進步最明顯的反而是 Opus 系列。Sonnet 5 的任務,就是把這個落差拉近——它的表現已經很接近 Opus 4.8,但價格更低。相較於前一代 Sonnet 4.6,Sonnet 5 在推理、工具使用、寫程式、知識工作這幾個 agentic 能力的重要面向上,都有實質進步。
官方也提供了具體的評測對比:在「agentic 搜尋」評測 BrowseComp,以及「電腦操作」評測 OSWorld-Verified 上,Sonnet 5 在不同的「思考努力等級(effort level)」設定下,都是 Sonnet 4.6 的明確升級版,涵蓋的成本效能區間也比 Sonnet 4.6 寬廣許多——在中等努力等級就能提供明顯更好的成本效率,而拉高努力等級後,某些任務的表現甚至能追上 Opus 4.8。換句話說,Anthropic 現在讓使用者可以透過調整 Sonnet 5 跟 Opus 4.8 的努力等級,自己去找成本跟效能之間最適合的平衡點,而不是只能整包選一顆模型。
定價:限時優惠只到 8 月底,之後會漲一截
這是這篇文章最想提醒大家的重點。Sonnet 5 上線時採用的是限時的「導入優惠價」:每百萬輸入 Token 2 美元、每百萬輸出 Token 10 美元,優惠期間到 2026 年 8 月 31 日為止;優惠期一過,會回到標準定價,每百萬輸入 Token 3 美元、每百萬輸出 Token 15 美元。作為對照,Opus 4.8 的定價是每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元——即使照 Sonnet 5 之後的標準價格算,仍然明顯比 Opus 4.8 便宜,而現在的限時優惠價又比標準價更低一截。
目前 Sonnet 5 已經全面上線:它是 Free 與 Pro 方案的預設模型,Max、Team、Enterprise 用戶也可以使用,同時開放 Claude Code 與 Claude Platform 呼叫(API 模型代號 `claude-sonnet-5`)。Anthropic 也同步調高了 Chat、Cowork、Claude Code、Claude Platform 幾個介面的速率限制,以因應使用者調高努力等級之後隨之增加的 Token 用量。
安全評測:比前代更安全,但仍落後於 Opus 4.8 與 Mythos Preview
官方揭露的安全評測結果,方向是正面的:Sonnet 5 在 agentic 情境下的安全性有進步,更擅長拒絕惡意請求、抵抗提示注入這類劫持嘗試,幻覺與過度迎合(sycophancy)的比例也比 Sonnet 4.6 低。在 Anthropic 自己的自動化行為稽核中,Sonnet 5 整體不當行為的比例比 Sonnet 4.6 低——也就是更安全。
不過官方也老實揭露了一個對照結果:雖然比前代安全,Sonnet 5 在這項稽核上的不當行為比例,仍然比更強的 Opus 4.8「以及 Claude Mythos Preview」來得高。這裡值得特別說明一下:這裡官方原文用的名稱是「Claude Mythos Preview」,跟我們先前 Opus 5 那篇文章提到的「Mythos 5」,雖然都屬於 Anthropic 內部同一個高階模型脈絡下的稱呼,但這是官方在這個場合使用的原始用詞,我們如實保留,不做名詞統一或簡化,避免混淆兩個不同的具體名稱。
資安能力方面,官方表示並未刻意訓練 Sonnet 5 做資安攻擊任務,它可以處理一些例行、無害的資安工作,但在測試潛在危險資安技能(例如開發軟體漏洞攻擊手法)的評測上,表現明顯遜於 Opus 4.8 這類模型。官方引用一項與 Mozilla 合作開發的評測,測試模型能否針對 Firefox 瀏覽器的漏洞開發出完整攻擊手法(測試對象為 Firefox 147 版本,所有漏洞在 148 版都已修補):Sonnet 4.6 跟 Sonnet 5 兩個版本都沒有成功開發出完整可用的攻擊手法,成功率都是 0.0%;Sonnet 5 只在「部分成功」的比例上,比 Sonnet 4.6 略高一點,官方判斷這比較像是模型整體智力提升的副作用,而不是刻意鍛鍊資安能力的結果。
正因為 Sonnet 5 在資安能力上比前代稍強一些,官方預設就替它啟用了資安防護機制——跟 Opus 4.7、4.8 用的是同一套,但比 Fable 5 那一套要寬鬆(因為官方判斷 Sonnet 5 整體資安風險偏低,不需要 Fable 5 那種會擋下更大範圍資安任務的嚴格防護)。另外官方註明一個細節:Sonnet 5 也被納入了 Cyber Verification Program(CVP)——這正是我們在 Opus 5 那篇文章提過的同一個受驗證機構專用管道,通過驗證的資安研究單位可以在這個管道下拿到限制較少的版本。
合作夥伴怎麼說:官方發布頁上的具名證言
官方發布頁上列出了大約十則具名合作夥伴的證言,這裡先說明清楚:以下引用的是 Anthropic 自己發布頁上列出的證言,屬於官方精選的客戶回饋,不是本站獨立採訪或第三方評測,這點要跟大家講清楚。舉兩則當代表:Cursor 的工程師 Neel Chotai 提到,他請 Sonnet 5 去調查一個 bug,模型在沒被特別要求的情況下,自己寫了一個可重現問題的測試、實作修正,還自己把修正暫存起來確認 bug 真的是被那個改動修好的,整個過程一次到位。另一位是 GM Yusuke Kaji,他提到讓 Sonnet 5 做「更新 Salesforce 帳戶分級、發送上線公告給企業聯絡人」這兩件事,模型從頭到尾自己做完,過去這種任務常常做到一半就卡住。
值得一提的是,我們在查證過程中也留意到,YouTube 上有幾支評測影片對 Sonnet 5 的評價其實兩極,不乏標題明顯偏負面的評論(質疑它是否「不如預期」甚至「變貴又變笨」)。這篇文章不會替任何一方背書,也不會採信任何未經證實的具體負評細節——如實揭露「社群反應不一」這個方向,是想提醒你:官方發布頁上的證言跟評測數字都是真實的,但終究是官方精選的正面案例,實際好不好用,還是建議你拿自己的任務去實測,而不是只看官方或單一評測影片的說法。
對企業採購跟 Token 預算規劃的實務意義
把前面的重點收斂成幾個實務判斷點。第一,如果你現在的工作流程已經在用 Opus 4.8 做一些不見得需要頂規能力的任務,Sonnet 5 值得放進來重新評估——尤其在優惠價還沒到期的這段期間,價格落差更大。第二,努力等級(effort level)是一個值得認真調整的旋鈕,而不是預設值就直接上線:同一顆 Sonnet 5,用不同努力等級跑,成本效能的落點差很多,拉高等級甚至能在某些任務上追平 Opus 4.8,這代表「該用哪顆模型」跟「該用哪個努力等級」現在是要一起考慮的兩個變數。第三,8 月 31 日這個優惠截止日期是有明確時效性的——如果你的用量規模夠大、正在評估要不要現在導入 Sonnet 5,把這個時間點放進你的採購時程規劃裡,會比事後才發現價格已經調整要實際。
FAQ
Q1:Claude Sonnet 5 跟 Claude Opus 4.8 該怎麼選?
Sonnet 5 定位是用更低價格逼近 Opus 4.8 的表現,透過調整努力等級,某些任務甚至能追平 Opus 4.8;但官方安全評測顯示 Sonnet 5 在整體不當行為比例上仍略高於 Opus 4.8。實務上建議先用自己的任務實測比較,複雜度極高、風險敏感的任務可以優先留給 Opus 4.8,一般 agentic 任務可以先試 Sonnet 5。
Q2:Sonnet 5 的優惠定價什麼時候結束?
根據官方公告,導入優惠價(每百萬輸入 Token 2 美元、輸出 10 美元)的期限到 2026 年 8 月 31 日,之後會恢復標準定價(每百萬輸入 Token 3 美元、輸出 15 美元)。
Q3:Sonnet 5 安全嗎?跟 Sonnet 4.6 比起來呢?
官方揭露 Sonnet 5 整體不當行為比例比 Sonnet 4.6 低,在 agentic 情境下也更擅長拒絕惡意請求、抵抗提示注入攻擊,幻覺與過度迎合的比例也較低。不過官方同時揭露,這項指標仍略高於 Opus 4.8 與 Claude Mythos Preview,並非全面優於所有模型。
Q4:Sonnet 5 的資安攻擊能力強嗎?
官方表示並未刻意訓練 Sonnet 5 做資安攻擊任務,在與 Mozilla 合作開發的漏洞利用評測中,Sonnet 5 未能成功開發出完整可用的攻擊手法(成功率 0.0%,與前代相同),資安能力明顯低於 Opus 4.8 這類模型。
Q5:所有關於 Sonnet 5 的評價都是正面的嗎?
不是。官方發布頁列出的具名客戶證言以正面回饋為主,但 YouTube 上也有部分獨立評測影片標題明顯偏負面。本文不採信任何未經證實的具體負評細節,但如實提醒讀者,實際使用體驗因人而異,建議自行針對任務實測,而不只是參考官方或單一評測的說法。
資料來源聲明
本文選題觸發來源為 YouTube 影片《Claude Sonnet 5 | First impressions》(頻道:Arena AI,發布時間約在 Anthropic 官方公告後)。Copywriter 本人並未觀看該影片、亦未取得其逐字稿,因此本文不含任何對影片畫面或話術的轉述。本次選題也未使用 Apify streamers/youtube-scraper 抓取精確觀看數(本 session 無 APIFY_TOKEN 可用),觀看數欄位如實留空,未以估計值充數。本文全部具體事實——定價、可用性、benchmark 對比、安全評測結果、資安能力評測、客戶證言——均直接查證自 Anthropic 官方發布頁(anthropic.com/news/claude-sonnet-5),以 curl 調閱完整原始 HTML 逐項核對,非依賴影片內容或任何二手轉述。文中引用之客戶證言為官方發布頁本身列出之具名合作夥伴證言,非本站獨立採訪。
延伸閱讀
立即行動
如果你正在評估要不要趁優惠期導入 Claude Sonnet 5、或是想搞清楚不同努力等級實際會花多少 Token,歡迎免費試用 AI Token King,讓我們幫你把不同模型、不同設定的實際用量與成本攤開來看,用數字決定選型,而不是只看官方行銷說法。

留言