Claude Opus 5 发布:复杂任务的新默认模型

Claude Opus 5 以 Opus 4.8 相同价格上线,能力逼近 Fable 5。它不只是在跑分上提升,更把复杂工程、Agent、科研和企业自动化任务的可用门槛往下拉了一截。

Claude Opus 5 发布

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5。它已经出现在 Claude.ai、Claude Code、Claude Platform 等入口里,也接入了 Anthropic API、Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry。

这次发布最容易被写成一句“性能爆炸”。但如果只盯着峰值跑分,反而会错过重点。

Opus 5 并不是 Anthropic 体系里最顶端、最昂贵、最神秘的模型。它接替 Opus 4.8,成为 Opus 层级的新旗舰,API 模型 ID 是 claude-opus-5。它的核心变化更像一次“前沿能力下放”:用 Opus 4.8 的价格,拿到接近 Claude Fable 5 的能力。

这件事对开发者和企业用户都很实际。过去遇到复杂任务,常见做法是先用 Sonnet,卡住了再升到更贵的 Fable。现在这条调用路径要重新算账了。很多任务可以先交给 Opus 5,只有在它明显不够用时,再切到 Fable 5 或更高层级模型。

当旗舰模型之间的峰值差距缩小,问题就变了:同样花 10 美元,模型到底能帮你完成多少有效工作?

Opus 5 在 Claude 模型梯队里的位置

Anthropic 现在的模型层级大致可以这样理解:

模型层级 主要用途 适合任务
Haiku 4.5 轻量、低延迟 分类、摘要、简单问答、批量小任务
Sonnet 5 日常主力 写作、常规编码、客服、知识检索
Opus 5 高频复杂任务 跨文件工程、Agent、长文档、科研辅助
Fable 5 / Mythos 5 更前沿或受限任务 极高难度推理、特殊安全策略下的任务

官方没有公开 Opus 5 的参数规模,也没有给出新的上下文窗口数字。这里没必要猜。对实际用户来说,更重要的是三件事:能不能做成事、成本能不能接受、接入以后会不会稳定。

Opus 5 的定位很清楚。它不是低价快模型,也不是实验室展示肌肉的顶配模型。它瞄准的是那些“普通模型能做一半,但做到最后容易塌”的任务。

比如:

  • 一个真实代码仓库里,bug 横跨多个文件;
  • 一个 Agent 需要连续打开网页、读取状态、调用工具、再检查结果;
  • 一份法律或金融文档里,模型要对表格、数字和上下文同时保持敏感;
  • 一个科研任务需要理解实验描述、处理长文本,再给出可验证的推理链。

这些任务的共同点是:失败通常不是完全不会,而是中途漏条件、忘约束、改坏旧逻辑,或者输出看起来很顺,但经不起测试。

Opus 5 要解决的就是这个缝隙。

跑分亮眼,但先别把厂商自测当成生产结论

官方给出的数据确实好看。Opus 5 在多项基准上逼近 Fable 5,有些项目还超过了它。尤其是在成本维度上,Opus 5 的优势很明显。

评测或场景 Opus 5 表现 对比信息 需要注意
Frontier-Bench v0.1 超过 Opus 4.8 两倍 单任务成本更低 厂商自测为主
CursorBench 3.2 最高 effort 与 Fable 5 峰值差距不到 0.5% 单任务成本约为 Fable 5 一半 真实仓库效果需复测
ARC-AGI 3 得分为次优模型三倍 强调抽象推理能力 基准与实际应用仍有距离
OSWorld 2.0 以约三分之一成本超过 Fable 5 最佳成绩 面向计算机操作任务 环境差异会影响结果
生命科学内部评测 全面优于 Opus 4.8 有机化学结构推断高 10.2 个百分点,蛋白质变异功能预测高 7.7 个百分点 内部评测口径需谨慎

还有一些早期数据也很有参考价值。比如 SWE-bench Pro 中 Opus 5 被提到达到 79.2%,Frontier-Bench xhigh 为 44.4,OSWorld 2.0 为 70.6。第三方创作者的早期观察里,Deep SWE 任务中 Opus 5 大约 68.8 分,Fable 5 约 70 分,GPT 5.6 SOL 约 73 分。

这些数字放在一起,会得到一个相对清晰的判断:Opus 5 大概率已经进入“接近 Fable 5,但成本低很多”的区间。

但这里要踩一脚刹车。

这些关键数据主要来自厂商自测、早期客户反馈和个人实测转述,还没有被大规模第三方独立复现。基准测试也不等于生产环境。真实团队用模型,常常会遇到更琐碎的问题:私有代码风格、脏数据、权限限制、工具调用失败、上下文里混着旧文档和新需求。

模型在榜单上接近 Fable 5,不代表它在你的仓库、你的工作流、你的地区接入条件下也能稳定接近 Fable 5。更稳妥的做法是拿自己的历史任务复测。别拿演示题。拿过去 Sonnet 或 Opus 4.8 真正卡住过的任务。

软件工程:Opus 5 最容易体现价值的地方

如果只选一个最该测试 Opus 5 的场景,我会选软件工程。

不是让它写一个小组件,也不是让它生成一个登录页。那类任务 Sonnet 已经很够用。Opus 5 更适合做重一点、脏一点、上下文更长的工程活。

例如:

  • 跨文件重构,把一个旧模块拆成更清晰的服务层;
  • 在真实仓库里定位缺陷,而不是修一道干净的算法题;
  • 设计多文件架构,考虑接口、状态、错误处理和测试;
  • 调试一个“本地偶现、线上高频”的边界问题;
  • 阅读旧代码后补功能,不能破坏已有行为。

官方案例里有一个细节很有意思。Opus 5 在开源包管理器的真实缺陷中,发现了社区补丁遗漏的边界情况。这个例子说明,它的价值不只是“帮你写代码”。更高价值的部分是:它能像一个认真看过上下文的工程师,问一句“这个补丁有没有漏掉某种输入?”

这类能力比生成代码更稀缺。因为真实项目里,写出一段能跑的代码并不难,难的是别把旁边的东西弄坏。

早期个人实测也提到几个比较接地气的任务:复刻一个游戏、修复开源项目在 Windows 平台上宠物消失的 bug、给开源项目增加 skills 读取路径能力。其中 bug 修复任务里,Opus 5 不只是按提示改动,还发现并处理了原有边界问题。

这就是复杂编码模型和普通补全模型的差别。普通模型经常像一个手快的实习生:你让它改哪,它就改哪。强一点的模型会先看周围逻辑,再判断这个改动会不会牵出别的问题。

Claude Code 用户可能会更快感受到这种差异。因为 Claude Code 本身就把模型放进了一个工程现场:能读文件、能改文件、能跑命令、能看错误、能继续修。模型如果只会单轮回答,价值有限;模型如果能多轮校验,效果会放大。

Agent 场景:会不会自我校验,比会不会回答更重要

Opus 5 的另一个主战场是 Agent。

很多人对 Agent 的期待过高,以为模型只要接了浏览器、终端、数据库,就能自己完成一串复杂工作。现实经常比较狼狈:模型会忘记检查结果,会误解页面状态,会在工具失败后假装成功,会把半成品包装成完成。

所以 Agent 模型最重要的能力不是说得像不像,而是能不能在不确定的环境里反复确认。

Opus 5 这次被反复强调的能力,正是“自我校验与迭代”。它能检查自己的输出,构建验证流程,根据验证结果改方案。这个能力听起来普通,但在长链路任务里非常关键。

官方 Frontier-Bench 案例中,模型在无法直接查看机械图纸的情况下,自己写了一个计算机视觉管线,从原始像素里提取几何信息,最后重建出 3D FreeCAD 模型。其他对比模型五次尝试都失败了。这个案例的重点不在 FreeCAD,而在模型没有停留在“我看不到图纸,所以无法完成”。它换了一条路:从像素里提取结构,再生成模型。

这就是 Agent 工作中经常需要的能力。任务不会总是给你现成接口。有时没有测试,有时没有文档,有时页面渲染结果和代码预期对不上。强模型要能自己搭一套检查办法。

Claude Platform 和桌面端相关能力也让这种工作方式更自然。模型可以打开页面,对照渲染结果检查代码,发现前端错位、样式没生效、交互不符合预期,再回去修改。过去很多前端生成任务失败,不是因为代码不会写,而是模型根本看不到最终页面。能看见、能比较、能修改,事情就变了。

Zapier 的企业自动化案例也说明了类似问题。模型在 AutomationBench 中完整执行客户流失预防流程,包括标记风险账户、通知负责人并生成摘要。这不是单点问答,而是一串业务动作。每一步都可能出错:对象选错、条件判断错、消息发错人、摘要漏掉关键字段。模型越能自检,流程越不容易悄悄偏航。

法律、金融和科研:精度敏感任务仍要人把关

Opus 5 对专业知识工作者也有吸引力,尤其是法律、金融和科研场景。

这些场景通常有三个特点:文本长、数字多、错误贵。一个法律文书批注错了,可能影响合同谈判。一个财务表格里的百分点看错了,后面的判断全歪。一个科研任务里把实验条件读错,结论再漂亮也没用。

Opus 5 的提升主要体现在几类工作:

场景 可交给 Opus 5 的任务 仍需人工确认的部分
法律 长合同审阅、条款对照、文书批注、风险点整理 法律适用、最终意见、责任判断
金融 表格读取、数值推理、报告草稿、异常项解释 投资建议、风险定价、合规结论
科研 文献整理、实验方案比对、分子结构或序列任务辅助 实验结论、统计显著性、领域假设
企业知识管理 长文档问答、流程归纳、跨文档检索 权限边界、内部政策解释

生命科学评测中,Opus 5 在 Anthropic 内部测试里全面优于 Opus 4.8。有机化学分子结构推断任务高出 10.2 个百分点,蛋白质序列变异功能预测任务高出 7.7 个百分点。这个提升不小。对科研辅助来说,哪怕只是减少几轮试错,也能节省大量时间。

但这类场景不适合“全自动放行”。Opus 5 可以做第一轮高质量分析,帮人把材料摊开,把可能路径列出来,把计算过程写清楚。最后的专业判断仍要人负责。原因很简单:模型的错误往往不像搜索引擎返回空结果那么明显。它可能把一个错误数字写得很有把握。

强模型降低的是整理、推理和验证成本,不是专业责任。

Opus 5 真正的变化:少几轮、少一些 token、稳定一点

很多模型发布会喜欢讲“更聪明”。但在真实使用里,聪明并不是一个好衡量指标。更有用的问题是:

  • 同一个任务,它要不要反复追问?
  • 第一次输出能不能接近可用?
  • 工具调用会不会乱跑?
  • 失败后能不能自己定位原因?
  • 批量任务里,前后结果波动大不大?
  • token 花费是不是明显下降?

Opus 5 的早期反馈,恰好集中在这些地方。

Harvey 的反馈提到,Opus 5 在较低推理档位即可达到 Opus 4.8 最高推理档的质量,平均 token 消耗降低约 26%。这条信息比“某个榜单提高多少”更接近企业真实关心的问题。因为企业调用模型不是一次,而是每天成千上万次。每次少一点 token,每次少一轮返工,月账单和交付速度都会变。

Lovable 的反馈重点也不是峰值,而是运行间波动更小。对自动化生成产品、批量构建页面、持续处理客户需求的团队来说,稳定性非常重要。一个模型偶尔特别聪明,意义不如它每天都不乱来。

可以用一个简单例子来理解。

假设团队每天让模型处理 100 个复杂任务。旧模型平均每个任务要 5 轮,常常需要人类补两次提示。Opus 5 如果把平均轮次降到 3 轮,把 token 消耗降 20% 以上,把失败任务减少一批,那么它带来的不只是模型账单下降,还有人的等待时间下降、上下文切换下降、返工下降。

这才是“价格不变、能力提升”的实际含义。不是海报上的曲线更陡,而是工程师少盯几次屏幕,运营少检查几条错误记录,法务少把同一份文件来回改三遍。

价格不变,但 thinking 和 effort 要重新检查

Opus 5 API 定价为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同,约为 Fable 5 的一半。

项目 Opus 5
输入价格 每百万 token 5 美元
输出价格 每百万 token 25 美元
与 Opus 4.8 对比 价格相同
与 Fable 5 对比 约为一半
Batch API 标准 API 价格的一半
Fast 模式 速度约为默认模式 2.5 倍
Fast 模式计费 Claude Platform 上按基础价格两倍计费
Claude Code 通过用量额度使用

接入渠道也比较完整。Claude.ai、Claude Code、Claude Cowork、Anthropic API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry 都可使用。对云厂商已有采购和权限体系的团队来说,这会减少不少落地阻力。

不过,API 迁移不能只把模型名从旧 ID 改成 claude-opus-5。有几个参数要认真看。

首先是 max_tokens。Opus 5 默认开启 thinking,思考过程会消耗输出 token。如果你沿用过去很紧的输出上限,可能会出现回答被截断、结构不完整、成本预估偏差等问题。

其次是 effort 档位。xhigh/max 档位不能关闭 thinking,关闭会返回 400 错误。也就是说,如果你之前在路由层里硬编码了某些“关闭思考”的策略,迁移后要测一遍。

更稳妥的做法是先小流量验证:

检查项 为什么要测
max_tokens thinking 会占用输出预算
thinking 开关 高 effort 档位不能随意关闭
effort 档位 不同任务的质量、速度、成本差异明显
Fast 模式 速度更快,但计费和质量表现要实测
路由策略 Sonnet、Opus 5、Fable 5 的分工可能变化
失败回退 安全分类器或参数错误可能触发回退逻辑

安全策略方面,Anthropic 称 Opus 5 在自动化行为审计中失准行为得分较低,欺骗性行为比例最低。被安全分类器标记的请求,可以回退至 Opus 4.8 或其他模型。企业用户如果有严格的审计和合规要求,需要把这类回退路径写进系统设计里,而不是上线后临时处理。

还有一个很现实的用户体验问题:账号稳定性。早期创作者实测中,多次提到 Claude 登录、封号或使用受限带来的不确定性。这个问题不影响 Opus 5 的模型能力判断,却会影响个人用户是否值得立即订阅。模型再强,如果账号无法稳定使用,体验就会打折。API 用户相对可控,但也要确认地区接入、计费方式和团队权限。

默认模型该不该换成 Opus 5?

如果你已经是 Claude Max 用户,Opus 5 成为默认模型,直接拿它跑过去的复杂任务即可。别从简单提示开始测。简单任务很难拉开差距。拿那些过去让 Sonnet 卡住、让 Opus 4.8 成本偏高、让 Fable 5 又显得太贵的任务。

Claude Pro 用户也值得关注。Opus 5 是 Pro 用户可使用的最强模型,这意味着一些过去只能靠更高档位模型完成的复杂任务,现在有了更便宜的入口。

API 用户要更克制。不要一夜之间把全部高难任务切到 Opus 5。比较好的做法是分三步:

  1. 选 20 到 50 个历史复杂任务,覆盖编码、长文档、Agent、数值推理等类型;
  2. 用 Sonnet 5、Opus 4.8、Opus 5、Fable 5 在相同输入下做对比;
  3. 记录成功率、人工修改次数、总 token、墙钟时间和失败原因。

只看单次输出质量不够。很多模型第一次回答都不错,差距出现在第二轮、第三轮,出现在工具失败后的恢复能力,出现在复杂上下文里的细节保持。

可以给一个简单的路由建议:

任务类型 推荐起点
简单分类、摘要、格式转换 Haiku 4.5
日常写作、普通代码、常规问答 Sonnet 5
跨文件工程、Agent、长文档研究 Opus 5
极高难度推理、Opus 5 多次失败任务 Fable 5
成本敏感的大批量离线任务 Batch API + 分层路由

这套路由的变化在于,Opus 5 接过了许多过去会直接交给 Fable 5 的任务。它不一定每次都赢 Fable 5,但如果质量接近、成本只有一半,默认选择就会改变。

Opus 5 的意义:把“够强且够便宜”推到复杂任务里

Claude Opus 5 不是一个只靠榜单存在的模型。它更像 Anthropic 给复杂任务市场的一次价格重排。

它维持 Opus 4.8 的价格,能力逼近 Fable 5,并把自我校验、工具使用、稳定输出这些更贴近生产环境的能力往前推了一步。对开发团队、Agent 构建者、企业自动化用户来说,这比单纯刷新某个跑分更有用。

当然,现在还不能把它神化。官方数据很亮眼,早期实测也显示出强势表现,但第三方复测和更大规模生产验证仍然必要。账号可用性、地区接入、API 参数迁移、thinking 成本、effort 档位,都会影响最后的使用体验。

如果你已经有 Claude 订阅,可以拿过去真正难住模型的任务重新测一遍。让它修一个旧 bug,改一个多文件模块,读一份长文档,或者跑一个带验证环节的 Agent 流程。不要只看它说得好不好,要看它能不能少犯错、少返工、少浪费 token。

如果你是 API 用户,先小流量接入。把 thinkingmax_tokens、effort、Fast 模式和回退策略测清楚,再扩大使用。

Opus 5 最值得关注的地方,不是它是不是 Anthropic 最强模型,而是它让“复杂任务默认交给更强模型”这件事变得更划算了。