7 月 24 日,Anthropic 發了 Claude Opus 5。光看版本號,這就是 Opus 4.8 往前挪了一格,沒什麼好激動的。但這次真正的變化不在分數欄,在價格欄——接近上一檔旗艦的能力,被放進了 Opus 原本的價位。同價對上 4.8 是純升級,跨檔對上 Fable 5 是半價夠用。代價是有個不顯眼的錢坑,直接改模型 ID 的人多半會踩。

不到兩個月的第四個模型,這次值得停一下

先把口徑擺出來。這篇裡所有分數都來自官方發布與公開彙整,我自己沒跑過這些基準——ARC-AGI、GDPval 這類東西不是個人在筆電上能重現的。基準還會隨版本更新,數字以官方頁面當時公布的為準。看趨勢就夠了,別去記小數點。

Anthropic 最近發模型的密度有點嚇人:Mythos 5、Fable 5、Sonnet 5,然後是 7 月 24 日的 Opus 5——不到兩個月,四個。發這麼密的副作用是大家開始跳過發布說明:反正下個月還有新的,等穩定了再說。

但這次值得花十分鐘看一眼,原因不是它更強,是它強在哪個價格檔上。官方給 Opus 5 的定位是:接近 Fable 5 的前沿智能,同時維持 Opus 的價位。講白話就是,原本要花上一檔的錢才買得到的能力水準,現在中間這一檔就能拿到大部分。它在 Claude Max 上成了新的預設模型,在 Pro 上是能用到的最強那個。

規格上幾條值得記住:定價每百萬 input token 5 美元、每百萬 output token 25 美元;上下文視窗 1M token;思考強度支援 low、medium、high 三檔切換,另外還有 xhigh。還有一條不在規格表的顯眼位置、卻最能影響帳單的——thinking 預設是開著的。這條值得單開一節,放在第四節說。

和 Opus 4.8 比:一分錢沒漲,一項也沒退

結論先給:這是同價升級,而且是那種可以放心換的同價升級。

Opus 4.8 是 5 月 28 日發的,定價 5 美元 / 25 美元。Opus 5 一模一樣。所以這一對比起來最乾淨——不用算 CP 值,單看能力差就行。

項目Opus 4.8Opus 5
定價(每百萬 token)輸入 5 美元 · 輸出 25 美元輸入 5 美元 · 輸出 25 美元
SWE-bench Pro69.2%79.2%
推理類基準平均72.190.4
Frontier-Bench v0.1官方稱 Opus 5 約為 4.8 的兩倍表現,且每項任務花費更少
公開對比中佔優的項數0 項6 項

SWE-bench Pro 從 69.2% 到 79.2%,整整十個百分點,這一欄是寫程式的人最容易有體感的。推理類基準平均 90.4 對 72.1,拉得更開。Frontier-Bench v0.1 上官方的說法是 Opus 5 大約有 4.8 的兩倍表現,而且每項任務花的錢更少。

但我覺得資訊量最大的不是任何一個分數,是那個「六比零」:據公開對比,Opus 5 在六項基準上更好——BrowseComp、DeepSWE 1.1、FrontierCode 1.1、GDPval-AA、HealthBench Professional、Humanity’s Last Exam——而 Opus 4.8 在零項上更好。

這六項裡你多半只有一兩項跟自己的活沾得上邊。BrowseComp 是網頁檢索,DeepSWE 和 FrontierCode 偏寫程式,GDPval-AA 偏真實職業任務,HealthBench Professional 是醫療,Humanity’s Last Exam 是那種刻意刁難的超難題庫。所以真正有用的資訊不是「贏了六項」,是「輸了零項」。

換模型最煩人的從來不是新的不夠強,是某個你依賴的能力悄悄退了半格。你的 prompt 是照著舊模型的脾氣調出來的,新模型在你不在意的榜上漲三分,在你天天用的那個環節掉兩分,而你要等上線出問題才發現。「零項退步」這一條,比任何一個具體分數都更能決定要不要換。

所以對已經在用 4.8 的人:能力這一側的換代風險很低。成本那一側不是,往下看第四節。

和 Fable 5 比:一半的價錢,差距縮到哪一步了

這才是這次發布真正的看點。Fable 5 是上一檔,定價每百萬輸入 10 美元、輸出 50 美元;Opus 5 是 5 美元和 25 美元,正好一半。

對比項Opus 5Fable 5
定價(每百萬 token)輸入 5 美元 · 輸出 25 美元輸入 10 美元 · 輸出 50 美元
Frontier-Bench43.3%33.7%
GDPval-AA v21,8611,747
agentic 任務平均90.884.6
SWE-bench Pro兩者相差一分以內,基本持平
ARC-AGI 3Opus 5 約為次優模型的 3 倍,本次發布數據裡最大的單項差距

這幾行說的是同一件事:在這些口徑上,Opus 5 已經追平甚至超過了上一檔,而價格只有一半。據公開數據,Frontier-Bench 是 43.3% 對 33.7%,GDPval-AA v2 是 1,861 對 1,747,agentic 任務平均 90.8 對 84.6,SWE-bench Pro 兩者差不到一分。

要單獨拎出來講的是 ARC-AGI 3。這一項據稱 Opus 5 大約是次優模型的三倍,是這次發布數據裡最大的單項差距。ARC-AGI 這套題衡量的不是「學過多少」,是「沒學過的能不能現推」:給一組它沒見過的規則,看它能不能自己找出模式。分數高不代表它知道得更多,代表它面對陌生問題時不那麼容易卡死。

這一項對一般使用者為什麼重要?日常真正難住你的,通常不是有標準答案的題——那種現在的模型早就答得不錯。難的是那些沒人寫過教學、你自己都說不清楚的活。當然,基準離你手邊那件事很遠,別把三倍當成體感三倍。

Fable 5 也沒有被淘汰。需要最長時間自主運行的場景——讓模型連續跑幾個小時、自己規劃自己糾錯、中途不插手的那種活——官方仍然把 Fable 5 放在那一檔上。如果你的用法是丟一個大任務出去然後去睡覺,這一條對你就是決定性的,別為了省一半單價換過來。

還有一條不太上榜但很實在:Opus 5 的安全分類器誤觸發頻率,據稱比 Fable 5 低約 85%。這個數對做安全研究、寫滲透測試腳本、處理金融與醫療文本的人來說,可能比任何基準分都值錢——正常工作被誤拒一次,你就得花時間重寫 prompt 繞過去,這種損耗不上任何評測表。

先說那個錢坑:thinking 是預設開著的

⚠ 換 ID 之前先讀這段

Opus 5 的 thinking 預設開啟。同一個 prompt,輸出的 token 會比關著思考時多。而 output 單價是 input 的五倍(25 美元對 5 美元)。結果就是:你只改了模型 ID,價目表上一分錢沒變,月底帳單卻可能變高。

這不是缺陷,是預設值變了。預設值的變化不會出現在價格表上,只會出現在帳單上,所以特別容易被忽略。

最容易中招的是這種人:原本在 Opus 4.8 上關著 thinking 跑一批便宜任務——分類、路由、把長文壓成摘要、格式轉換——這些活不需要模型想太多,關掉思考又快又省。看到 Opus 5 同價更強,一行程式碼把模型 ID 改了,別的什麼都沒動。能力確實上去了,輸出量也上去了,而且是在一個乘以五的單價上上去的。

四個防法,按 CP 值排:

  1. 換之前先拿小樣本比一次輸出量。挑二三十條你真實的請求,新舊模型各跑一遍,記下 output token 總數。這一步花不了十分鐘,卻是唯一能提前看到帳單變化的辦法。
  2. 按任務分 effort 檔,別一檔打天下。low、medium、high 三檔是給你用的,另外還有 xhigh。批次的簡單活給低檔,需要跨檔案推理、抓難纏的 bug 時再往上調。判斷標準不是這件事重不重要,是它需不需要模型多想幾步——不需要多想的任務,給再多思考預算也只是多付錢。
  3. 盯輸出量,別盯單價。一次請求的花費是「輸入量 × 輸入單價 + 輸出量 × 輸出單價」。這次變的是輸出量那一項,單價欄紋絲不動,所以只看價格表你永遠看不出問題。
  4. 真正跑量的任務考慮更低階的模型。把 Opus 5 壓到最低檔去跑摘要,通常不如直接換一個更便宜的模型划算。旗艦的價值在難題上,不在吞吐量上。

順帶說一句 1M 的上下文視窗:視窗是上限,不是目標。把一整個程式庫、一整年的紀錄一股腦丟進去,輸入量是實打實要付錢的,模型也未必更準。

三種活,三種選法

把上面的東西壓成能直接用的判斷:

日常寫程式、做分析、處理知識工作 → Opus 5。這一檔現在兩頭都佔:對下同價強過 4.8 且沒有退步項,對上半價接近 Fable 5。已經在用 4.8 的可以直接換,只要按上一節先把輸出量對一遍。

要讓模型自己跑很久的任務 → Fable 5 仍是那一檔。長鏈條、幾個小時不斷線、中途自我糾錯,這仍然是它的主場。這類用法本來就不多,但你要正好是,就別只盯著單價。

批次的簡單任務 → 往下走,不是往上走。分類、打標籤、路由、模板化摘要,拼的是單位成本和吞吐量,不是智商。這類活用旗艦是純浪費,哪怕它降到最低思考檔。

還有一條通用的:算總花費,不算單價。單價一樣的兩個模型,一個話多一個話少,月底帳單能差出一截;反過來,單價貴一倍的模型如果能一次做對、省掉三輪返工,可能反而便宜。真正該盯的是「把這件事做完一共花了多少」,不是價目表上那個數。

說給幣圈這批拿 AI 幹活的讀者:審下單和部位計算的程式碼、檢查 API 權限與例外處理,這種錯一次就是真金白銀的活,值得上 Opus 5;把一天的公告和推文壓成摘要,交給更便宜的檔;讓 agent 自己跑一整晚盯數據,那是 Fable 5 的場景。但邊界一點沒變,這些全是資訊處理,不是替你判斷。模型能陪你把 K 線的讀法過一遍、把邏輯漏洞挑出來,但它不知道明天漲還是跌;它整理出來的消息也可能是編的,尤其是那種聽起來特別順的。老騙局套個 AI 外殼回鍋的路數,我在加密被騙的 8 種姿勢裡寫過。

最後一件事,可能比選哪個模型更要緊:別把工作流程焊死在某個模型 ID 上。不到兩個月四個模型,你今天挑定的那個,過兩個月很可能既不是最強的也不是最便宜的。把模型 ID、effort 檔位、成本上限做成設定檔,換的時候改一行;留一小組你自己的真實任務當迴歸測試,新模型一出跑一遍,十幾分鐘就知道值不值得換。上一次我寫模型選型是 GPT-5.6 那三檔,那篇的結論到今天基本還成立——不是因為分數沒變,是因為「按任務分層、用剛好夠用的那一檔」這個方法本身不太會過時。

幾個我猜你會問的

Claude Opus 5 比 Opus 4.8 強多少?

按官方與公開彙整的口徑,SWE-bench Pro 從 69.2% 提到 79.2%,推理類基準平均是 90.4 對 72.1,Frontier-Bench v0.1 上官方稱 Opus 5 約為 4.8 的兩倍表現,而且每項任務花費更少。公開對比裡 Opus 5 在六項基準更好,Opus 4.8 在零項更好。兩者定價相同,都是每百萬輸入 token 5 美元、輸出 token 25 美元。這些數字我自己沒跑過,基準也會隨版本更新,以官方頁面當時公布的為準。

Opus 5 能取代 Fable 5 嗎?

多數任務可以,而且便宜一半——Fable 5 是每百萬輸入 10 美元、輸出 50 美元,Opus 5 是 5 美元和 25 美元。據公開數據,Opus 5 在 Frontier-Bench 是 43.3% 對 33.7%,GDPval-AA v2 是 1,861 對 1,747,SWE-bench Pro 兩者相差一分以內,agentic 任務平均 90.8 對 84.6。但需要最長時間自主運行的場景,Fable 5 仍是被指向的那一檔。

為什麼換成 Opus 5 之後帳單反而變高?

多半是 thinking 預設開啟。Opus 5 的 thinking 預設打開,同一個 prompt 會產生更多 output token,而 output 單價是 input 的五倍。如果你原本在 Opus 4.8 上關著 thinking 跑批次任務,只改模型 ID 其他不動,單價沒變但輸出量變了,帳單就可能不降反升。換之前先在小樣本上比一次 output token 數,再決定用哪一檔 effort。

日常寫程式該用哪一檔 effort?

Opus 5 支援 low、medium、high 三檔思考強度,另有 xhigh。日常改程式碼、寫小腳本用低檔通常夠用;需要跨檔案推理、設計介面、排查難纏的 bug 時再往上調。判斷標準不是這件事重不重要,是它需不需要模型多想幾步——不需要多想的任務,多給思考預算只會多付錢。


接著讀: GPT-5.6 三檔撞名幣圈 · 加密被騙的 8 種姿勢 · 什麼是比特幣