7 月 24 日,Anthropic 发了 Claude Opus 5。光看版本号,这就是 Opus 4.8 往前挪了一格,没什么好激动的。但这次真正的变化不在分数栏,在价格栏——接近上一档旗舰的能力,被放进了 Opus 原来的价位。同价对上 4.8 是纯升级,跨档对上 Fable 5 是半价够用。代价是有个不显眼的钱坑,直接改模型 ID 的人大概率会踩。
不到两个月的第四个模型,这次值得停一下
先把口径摆出来。这篇里所有分数都来自官方发布与公开汇总,我自己没跑过这些基准——ARC-AGI、GDPval 这类东西不是个人在笔记本上能复现的。基准还会随版本更新,数字以官方页面当时公布的为准。看趋势就够了,别去记小数点。
Anthropic 最近发模型的密度有点吓人:Mythos 5、Fable 5、Sonnet 5,然后是 7 月 24 日的 Opus 5——不到两个月,四个。发这么密的副作用是大家开始跳过发布说明:反正下个月还有新的,等稳定了再说。
但这次值得花十分钟看一眼,原因不是它更强,是它强在哪个价格档上。官方给 Opus 5 的定位是:接近 Fable 5 的前沿智能,同时维持 Opus 的价位。说人话就是,原本要花上一档的钱才买得到的能力水平,现在中间这档就能拿到大部分。它在 Claude Max 上成了新的默认模型,在 Pro 上是能用到的最强那个。
规格上几条值得记住:定价每百万 input token 5 美元、每百万 output token 25 美元;上下文窗口 1M token;思考强度支持 low、medium、high 三档切换,另外还有 xhigh。还有一条不在规格表的显眼位置、却最能影响账单的——thinking 默认是开着的。这条值得单开一节,放在第四节说。
和 Opus 4.8 比:一分钱没涨,一项也没退
结论先给:这是同价升级,而且是那种可以放心换的同价升级。
Opus 4.8 是 5 月 28 日发的,定价 5 美元 / 25 美元。Opus 5 一模一样。所以这一对比起来最干净——不用算性价比,单看能力差就行。
| 项目 | Opus 4.8 | Opus 5 |
|---|---|---|
| 定价(每百万 token) | 输入 5 美元 · 输出 25 美元 | 输入 5 美元 · 输出 25 美元 |
| SWE-bench Pro | 69.2% | 79.2% |
| 推理类基准平均 | 72.1 | 90.4 |
| Frontier-Bench v0.1 | 官方称 Opus 5 约为 4.8 的两倍表现,且每任务花费更少 | |
| 公开对比中占优的项数 | 0 项 | 6 项 |
SWE-bench Pro 从 69.2% 到 79.2%,整整十个百分点,这一栏是写代码的人最容易有体感的。推理类基准平均 90.4 对 72.1,拉得更开。Frontier-Bench v0.1 上官方的说法是 Opus 5 大约有 4.8 的两倍表现,而且每个任务花的钱更少。
但我觉得信息量最大的不是任何一个分数,是那个「六比零」:公开对比里 Opus 5 在六项基准上更好——BrowseComp、DeepSWE 1.1、FrontierCode 1.1、GDPval-AA、HealthBench Professional、Humanity’s Last Exam——而 Opus 4.8 在零项上更好。
这六项里你多半只有一两项跟自己的活沾边。BrowseComp 是网页检索,DeepSWE 和 FrontierCode 偏编码,GDPval-AA 偏真实职业任务,HealthBench Professional 是医疗,Humanity’s Last Exam 是那种刻意刁难的超难题集。所以真正有用的信息不是「赢了六项」,是「输了零项」。
换模型最烦人的从来不是新的不够强,是某个你依赖的能力悄悄退了半格。你的 prompt 是照着旧模型的脾气调出来的,新模型在你不关心的榜上涨三分,在你天天用的那个环节掉两分,而你要等线上出问题才发现。「零项退步」这条,比任何一个具体分数都更能决定要不要换。
所以对已经在用 4.8 的人:能力这一侧的换代风险很低。成本那一侧不是,往下看第四节。
和 Fable 5 比:一半的价钱,差距缩到哪一步了
这才是这次发布真正的看点。Fable 5 是上一档,定价每百万输入 10 美元、输出 50 美元;Opus 5 是 5 美元和 25 美元,正好一半。
| 对比项 | Opus 5 | Fable 5 |
|---|---|---|
| 定价(每百万 token) | 输入 5 美元 · 输出 25 美元 | 输入 10 美元 · 输出 50 美元 |
| Frontier-Bench | 43.3% | 33.7% |
| GDPval-AA v2 | 1,861 | 1,747 |
| agentic 任务平均 | 90.8 | 84.6 |
| SWE-bench Pro | 两者相差一分以内,基本持平 | |
| ARC-AGI 3 | Opus 5 约为次优模型的 3 倍,本次发布数据里最大的单项差距 | |
这几行说的是同一件事:在这些口径上,Opus 5 已经追平甚至超过了上一档,而价格只有一半。Frontier-Bench 43.3% 对 33.7%,GDPval-AA v2 是 1,861 对 1,747,agentic 任务平均 90.8 对 84.6,SWE-bench Pro 两者差不到一分。
要单独拎出来讲的是 ARC-AGI 3。这一项 Opus 5 大约是次优模型的三倍,是这次发布数据里最大的单项差距。ARC-AGI 这套题衡量的不是「学过多少」,是「没学过的能不能现推」:给一组它没见过的规则,看它能不能自己找出模式。分数高不代表它知道得更多,代表它面对陌生问题时不那么容易卡死。
这一项对普通用户为什么重要?日常真正难住你的,通常不是有标准答案的题——那种现在的模型早就答得不错。难的是那些没人写过教程、你自己都说不清楚的活。当然,基准离你手头那件事很远,别把三倍当成体感三倍。
Fable 5 也没有被淘汰。需要最长时间自主运行的场景——让模型连续跑几个小时、自己规划自己纠错、中途不插手的那种活——官方仍然把 Fable 5 放在那一档上。如果你的用法是丢一个大任务出去然后去睡觉,这一条对你就是决定性的,别为了省一半单价换过来。
还有一条不太上榜但很实在:Opus 5 的安全分类器误触发频率,据称比 Fable 5 低约 85%。这个数对做安全研究、写渗透测试脚本、处理金融和医疗文本的人来说,可能比任何基准分都值钱——正常工作被误拒一次,你就得花时间重写 prompt 绕过去,这种损耗不上任何评测表。
先说那个钱坑:thinking 是默认开着的
Opus 5 的 thinking 默认开启。同一个 prompt,输出的 token 会比关着思考时多。而 output 单价是 input 的五倍(25 美元对 5 美元)。结果就是:你只改了模型 ID,价目表上一分钱没变,月底账单却可能变高。
这不是缺陷,是默认值变了。默认值的变化不会出现在价格表上,只会出现在账单上,所以特别容易被忽略。
最容易中招的是这种人:原来在 Opus 4.8 上关着 thinking 跑一批便宜任务——分类、路由、把长文压成摘要、格式转换——这些活不需要模型想太多,关掉思考又快又省。看到 Opus 5 同价更强,一行代码把模型 ID 改了,别的什么都没动。能力确实上去了,输出量也上去了,而且是在一个乘以五的单价上上去的。
四个防法,按性价比排:
- 换之前先拿小样本比一次输出量。挑二三十条你真实的请求,新旧模型各跑一遍,记下 output token 总数。这一步花不了十分钟,却是唯一能提前看到账单变化的办法。
- 按任务分 effort 档,别一档打天下。low、medium、high 三档是给你用的,另外还有 xhigh。批量简单活给低档,需要跨文件推理、排查难 bug 的时候再往上调。判断标准不是这件事重不重要,是它需不需要模型多想几步——不需要多想的任务,给再多思考预算也只是多付钱。
- 盯输出量,别盯单价。一次请求的花费是「输入量 × 输入单价 + 输出量 × 输出单价」。这次变的是输出量那一项,单价栏纹丝不动,所以只看价格表你永远看不出问题。
- 真正跑量的任务考虑更低档的模型。把 Opus 5 压到最低档去跑摘要,通常不如直接换一个更便宜的模型划算。旗舰的价值在难题上,不在吞吐上。
顺带说一句 1M 的上下文窗口:窗口是上限,不是目标。把一整个仓库、一整年的记录一股脑扔进去,输入量是实打实要付钱的,模型也未必更准。
三种活,三种选法
把上面的东西压成能直接用的判断:
日常写代码、做分析、处理知识工作 → Opus 5。这一档现在两头都占:对下同价强过 4.8 且没有退步项,对上半价接近 Fable 5。已经在用 4.8 的可以直接换,只要按上一节先把输出量对一遍。
要让模型自己跑很久的任务 → Fable 5 仍是那一档。长链条、几个小时不断线、中途自我纠错,这仍然是它的主场。这类用法本来就不多,但你要正好是,就别只盯着单价。
批量简单任务 → 往下走,不是往上走。分类、打标签、路由、模板化摘要,拼的是单位成本和吞吐,不是智商。这类活用旗舰是纯浪费,哪怕它降到最低思考档。
还有一条通用的:算总花费,不算单价。单价一样的两个模型,一个话多一个话少,月底账单能差出一截;反过来,单价贵一倍的模型如果能一次做对、省掉三轮返工,可能反而便宜。真正该盯的是「把这件事做完一共花了多少」,不是价目表上那个数。
说给币圈这批拿 AI 干活的读者:审下单和仓位计算的代码、检查 API 权限和异常处理,这种错一次就是真金白银的活,值得上 Opus 5;把一天的公告和推文压成摘要,交给更便宜的档;让 agent 自己跑一整晚盯数据,那是 Fable 5 的场景。但边界一点没变,这些全是信息处理,不是替你判断。模型能陪你把 K 线的读法过一遍、把逻辑漏洞挑出来,但它不知道明天涨还是跌;它整理出来的消息也可能是编的,尤其是那种听起来特别顺的。老骗局套个 AI 外壳回锅的路数,我在加密被骗的 8 种姿势里写过。
最后一件事,可能比选哪个模型更要紧:别把工作流焊死在某个模型 ID 上。不到两个月四个模型,你今天挑定的那个,过两个月很可能既不是最强的也不是最便宜的。把模型 ID、effort 档位、成本上限做成配置,换的时候改一行;留一小组你自己的真实任务当回归测试,新模型一出跑一遍,十几分钟就知道值不值得换。上一次我写模型选型是 GPT-5.6 那三档,那篇的结论到今天基本还成立——不是因为分数没变,是因为「按任务分层、用刚好够用的那一档」这个方法本身不怎么过时。
几个我猜你会问的
Claude Opus 5 比 Opus 4.8 强多少?
按官方与公开汇总口径,SWE-bench Pro 从 69.2% 提到 79.2%,推理类基准平均是 90.4 对 72.1,Frontier-Bench v0.1 上官方称 Opus 5 约为 4.8 的两倍表现且每任务花费更少。公开对比里 Opus 5 在六项基准更好,Opus 4.8 在零项更好。两者定价相同,都是每百万输入 token 5 美元、输出 token 25 美元。这些数字我没有自己跑过,基准也会随版本更新,以官方页面当时公布的为准。
Opus 5 能替代 Fable 5 吗?
多数任务能,而且便宜一半——Fable 5 是每百万输入 10 美元、输出 50 美元,Opus 5 是 5 美元和 25 美元。公开数据里 Opus 5 在 Frontier-Bench 是 43.3% 对 33.7%,GDPval-AA v2 是 1,861 对 1,747,SWE-bench Pro 两者相差一分以内,agentic 任务平均 90.8 对 84.6。但需要最长时间自主运行的场景,Fable 5 仍是被指向的那一档。
为什么换成 Opus 5 之后账单反而变高了?
大概率是 thinking 默认开启。Opus 5 的 thinking 默认打开,同样一个 prompt 会产生更多 output token,而 output 单价是 input 的五倍。如果你原来在 Opus 4.8 上关着 thinking 跑批量任务,只改模型 ID 其他不动,单价没变但输出量变了,账单就可能不降反升。换之前先在小样本上比一次 output token 数,再决定用哪个 effort 档。
日常写代码该用哪一档 effort?
Opus 5 支持 low、medium、high 三档思考强度,另有 xhigh。日常改代码、写小脚本用低档通常够用;需要跨文件推理、设计接口、排查难 bug 时再往上调。判断标准不是这件事重不重要,是它需不需要模型多想几步——不需要多想的任务,多给思考预算只会多付钱。
接着读:GPT-5.6 三档撞名币圈 · 加密被骗的 8 种姿势 · 什么是比特币
