Claude Opus 5 发布:复杂任务的新默认模型
Claude Opus 5 以 Opus 4.8 相同价格上线,能力逼近 Fable 5。它不只是在跑分上提升,更把复杂工程、Agent、科研和企业自动化任务的可用门槛往下拉了一截。
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5。它已经出现在 Claude.ai、Claude Code、Claude Platform 等入口里,也接入了 Anthropic API、Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry。
这次发布最容易被写成一句“性能爆炸”。但如果只盯着峰值跑分,反而会错过重点。
Opus 5 并不是 Anthropic 体系里最顶端、最昂贵、最神秘的模型。它接替 Opus 4.8,成为 Opus 层级的新旗舰,API 模型 ID 是 claude-opus-5。它的核心变化更像一次“前沿能力下放”:用 Opus 4.8 的价格,拿到接近 Claude Fable 5 的能力。
这件事对开发者和企业用户都很实际。过去遇到复杂任务,常见做法是先用 Sonnet,卡住了再升到更贵的 Fable。现在这条调用路径要重新算账了。很多任务可以先交给 Opus 5,只有在它明显不够用时,再切到 Fable 5 或更高层级模型。
当旗舰模型之间的峰值差距缩小,问题就变了:同样花 10 美元,模型到底能帮你完成多少有效工作?
Opus 5 在 Claude 模型梯队里的位置
Anthropic 现在的模型层级大致可以这样理解:
| 模型层级 | 主要用途 | 适合任务 |
|---|---|---|
| Haiku 4.5 | 轻量、低延迟 | 分类、摘要、简单问答、批量小任务 |
| Sonnet 5 | 日常主力 | 写作、常规编码、客服、知识检索 |
| Opus 5 | 高频复杂任务 | 跨文件工程、Agent、长文档、科研辅助 |
| Fable 5 / Mythos 5 | 更前沿或受限任务 | 极高难度推理、特殊安全策略下的任务 |
官方没有公开 Opus 5 的参数规模,也没有给出新的上下文窗口数字。这里没必要猜。对实际用户来说,更重要的是三件事:能不能做成事、成本能不能接受、接入以后会不会稳定。
Opus 5 的定位很清楚。它不是低价快模型,也不是实验室展示肌肉的顶配模型。它瞄准的是那些“普通模型能做一半,但做到最后容易塌”的任务。
比如:
- 一个真实代码仓库里,bug 横跨多个文件;
- 一个 Agent 需要连续打开网页、读取状态、调用工具、再检查结果;
- 一份法律或金融文档里,模型要对表格、数字和上下文同时保持敏感;
- 一个科研任务需要理解实验描述、处理长文本,再给出可验证的推理链。
这些任务的共同点是:失败通常不是完全不会,而是中途漏条件、忘约束、改坏旧逻辑,或者输出看起来很顺,但经不起测试。
Opus 5 要解决的就是这个缝隙。
跑分亮眼,但先别把厂商自测当成生产结论
官方给出的数据确实好看。Opus 5 在多项基准上逼近 Fable 5,有些项目还超过了它。尤其是在成本维度上,Opus 5 的优势很明显。
| 评测或场景 | Opus 5 表现 | 对比信息 | 需要注意 |
|---|---|---|---|
| Frontier-Bench v0.1 | 超过 Opus 4.8 两倍 | 单任务成本更低 | 厂商自测为主 |
| CursorBench 3.2 最高 effort | 与 Fable 5 峰值差距不到 0.5% | 单任务成本约为 Fable 5 一半 | 真实仓库效果需复测 |
| ARC-AGI 3 | 得分为次优模型三倍 | 强调抽象推理能力 | 基准与实际应用仍有距离 |
| OSWorld 2.0 | 以约三分之一成本超过 Fable 5 最佳成绩 | 面向计算机操作任务 | 环境差异会影响结果 |
| 生命科学内部评测 | 全面优于 Opus 4.8 | 有机化学结构推断高 10.2 个百分点,蛋白质变异功能预测高 7.7 个百分点 | 内部评测口径需谨慎 |
还有一些早期数据也很有参考价值。比如 SWE-bench Pro 中 Opus 5 被提到达到 79.2%,Frontier-Bench xhigh 为 44.4,OSWorld 2.0 为 70.6。第三方创作者的早期观察里,Deep SWE 任务中 Opus 5 大约 68.8 分,Fable 5 约 70 分,GPT 5.6 SOL 约 73 分。
这些数字放在一起,会得到一个相对清晰的判断:Opus 5 大概率已经进入“接近 Fable 5,但成本低很多”的区间。
但这里要踩一脚刹车。
这些关键数据主要来自厂商自测、早期客户反馈和个人实测转述,还没有被大规模第三方独立复现。基准测试也不等于生产环境。真实团队用模型,常常会遇到更琐碎的问题:私有代码风格、脏数据、权限限制、工具调用失败、上下文里混着旧文档和新需求。
模型在榜单上接近 Fable 5,不代表它在你的仓库、你的工作流、你的地区接入条件下也能稳定接近 Fable 5。更稳妥的做法是拿自己的历史任务复测。别拿演示题。拿过去 Sonnet 或 Opus 4.8 真正卡住过的任务。
软件工程:Opus 5 最容易体现价值的地方
如果只选一个最该测试 Opus 5 的场景,我会选软件工程。
不是让它写一个小组件,也不是让它生成一个登录页。那类任务 Sonnet 已经很够用。Opus 5 更适合做重一点、脏一点、上下文更长的工程活。
例如:
- 跨文件重构,把一个旧模块拆成更清晰的服务层;
- 在真实仓库里定位缺陷,而不是修一道干净的算法题;
- 设计多文件架构,考虑接口、状态、错误处理和测试;
- 调试一个“本地偶现、线上高频”的边界问题;
- 阅读旧代码后补功能,不能破坏已有行为。
官方案例里有一个细节很有意思。Opus 5 在开源包管理器的真实缺陷中,发现了社区补丁遗漏的边界情况。这个例子说明,它的价值不只是“帮你写代码”。更高价值的部分是:它能像一个认真看过上下文的工程师,问一句“这个补丁有没有漏掉某种输入?”
这类能力比生成代码更稀缺。因为真实项目里,写出一段能跑的代码并不难,难的是别把旁边的东西弄坏。
早期个人实测也提到几个比较接地气的任务:复刻一个游戏、修复开源项目在 Windows 平台上宠物消失的 bug、给开源项目增加 skills 读取路径能力。其中 bug 修复任务里,Opus 5 不只是按提示改动,还发现并处理了原有边界问题。
这就是复杂编码模型和普通补全模型的差别。普通模型经常像一个手快的实习生:你让它改哪,它就改哪。强一点的模型会先看周围逻辑,再判断这个改动会不会牵出别的问题。
Claude Code 用户可能会更快感受到这种差异。因为 Claude Code 本身就把模型放进了一个工程现场:能读文件、能改文件、能跑命令、能看错误、能继续修。模型如果只会单轮回答,价值有限;模型如果能多轮校验,效果会放大。
Agent 场景:会不会自我校验,比会不会回答更重要
Opus 5 的另一个主战场是 Agent。
很多人对 Agent 的期待过高,以为模型只要接了浏览器、终端、数据库,就能自己完成一串复杂工作。现实经常比较狼狈:模型会忘记检查结果,会误解页面状态,会在工具失败后假装成功,会把半成品包装成完成。
所以 Agent 模型最重要的能力不是说得像不像,而是能不能在不确定的环境里反复确认。
Opus 5 这次被反复强调的能力,正是“自我校验与迭代”。它能检查自己的输出,构建验证流程,根据验证结果改方案。这个能力听起来普通,但在长链路任务里非常关键。
官方 Frontier-Bench 案例中,模型在无法直接查看机械图纸的情况下,自己写了一个计算机视觉管线,从原始像素里提取几何信息,最后重建出 3D FreeCAD 模型。其他对比模型五次尝试都失败了。这个案例的重点不在 FreeCAD,而在模型没有停留在“我看不到图纸,所以无法完成”。它换了一条路:从像素里提取结构,再生成模型。
这就是 Agent 工作中经常需要的能力。任务不会总是给你现成接口。有时没有测试,有时没有文档,有时页面渲染结果和代码预期对不上。强模型要能自己搭一套检查办法。
Claude Platform 和桌面端相关能力也让这种工作方式更自然。模型可以打开页面,对照渲染结果检查代码,发现前端错位、样式没生效、交互不符合预期,再回去修改。过去很多前端生成任务失败,不是因为代码不会写,而是模型根本看不到最终页面。能看见、能比较、能修改,事情就变了。
Zapier 的企业自动化案例也说明了类似问题。模型在 AutomationBench 中完整执行客户流失预防流程,包括标记风险账户、通知负责人并生成摘要。这不是单点问答,而是一串业务动作。每一步都可能出错:对象选错、条件判断错、消息发错人、摘要漏掉关键字段。模型越能自检,流程越不容易悄悄偏航。
法律、金融和科研:精度敏感任务仍要人把关
Opus 5 对专业知识工作者也有吸引力,尤其是法律、金融和科研场景。
这些场景通常有三个特点:文本长、数字多、错误贵。一个法律文书批注错了,可能影响合同谈判。一个财务表格里的百分点看错了,后面的判断全歪。一个科研任务里把实验条件读错,结论再漂亮也没用。
Opus 5 的提升主要体现在几类工作:
| 场景 | 可交给 Opus 5 的任务 | 仍需人工确认的部分 |
|---|---|---|
| 法律 | 长合同审阅、条款对照、文书批注、风险点整理 | 法律适用、最终意见、责任判断 |
| 金融 | 表格读取、数值推理、报告草稿、异常项解释 | 投资建议、风险定价、合规结论 |
| 科研 | 文献整理、实验方案比对、分子结构或序列任务辅助 | 实验结论、统计显著性、领域假设 |
| 企业知识管理 | 长文档问答、流程归纳、跨文档检索 | 权限边界、内部政策解释 |
生命科学评测中,Opus 5 在 Anthropic 内部测试里全面优于 Opus 4.8。有机化学分子结构推断任务高出 10.2 个百分点,蛋白质序列变异功能预测任务高出 7.7 个百分点。这个提升不小。对科研辅助来说,哪怕只是减少几轮试错,也能节省大量时间。
但这类场景不适合“全自动放行”。Opus 5 可以做第一轮高质量分析,帮人把材料摊开,把可能路径列出来,把计算过程写清楚。最后的专业判断仍要人负责。原因很简单:模型的错误往往不像搜索引擎返回空结果那么明显。它可能把一个错误数字写得很有把握。
强模型降低的是整理、推理和验证成本,不是专业责任。
Opus 5 真正的变化:少几轮、少一些 token、稳定一点
很多模型发布会喜欢讲“更聪明”。但在真实使用里,聪明并不是一个好衡量指标。更有用的问题是:
- 同一个任务,它要不要反复追问?
- 第一次输出能不能接近可用?
- 工具调用会不会乱跑?
- 失败后能不能自己定位原因?
- 批量任务里,前后结果波动大不大?
- token 花费是不是明显下降?
Opus 5 的早期反馈,恰好集中在这些地方。
Harvey 的反馈提到,Opus 5 在较低推理档位即可达到 Opus 4.8 最高推理档的质量,平均 token 消耗降低约 26%。这条信息比“某个榜单提高多少”更接近企业真实关心的问题。因为企业调用模型不是一次,而是每天成千上万次。每次少一点 token,每次少一轮返工,月账单和交付速度都会变。
Lovable 的反馈重点也不是峰值,而是运行间波动更小。对自动化生成产品、批量构建页面、持续处理客户需求的团队来说,稳定性非常重要。一个模型偶尔特别聪明,意义不如它每天都不乱来。
可以用一个简单例子来理解。
假设团队每天让模型处理 100 个复杂任务。旧模型平均每个任务要 5 轮,常常需要人类补两次提示。Opus 5 如果把平均轮次降到 3 轮,把 token 消耗降 20% 以上,把失败任务减少一批,那么它带来的不只是模型账单下降,还有人的等待时间下降、上下文切换下降、返工下降。
这才是“价格不变、能力提升”的实际含义。不是海报上的曲线更陡,而是工程师少盯几次屏幕,运营少检查几条错误记录,法务少把同一份文件来回改三遍。
价格不变,但 thinking 和 effort 要重新检查
Opus 5 API 定价为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同,约为 Fable 5 的一半。
| 项目 | Opus 5 |
|---|---|
| 输入价格 | 每百万 token 5 美元 |
| 输出价格 | 每百万 token 25 美元 |
| 与 Opus 4.8 对比 | 价格相同 |
| 与 Fable 5 对比 | 约为一半 |
| Batch API | 标准 API 价格的一半 |
| Fast 模式 | 速度约为默认模式 2.5 倍 |
| Fast 模式计费 | Claude Platform 上按基础价格两倍计费 |
| Claude Code | 通过用量额度使用 |
接入渠道也比较完整。Claude.ai、Claude Code、Claude Cowork、Anthropic API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry 都可使用。对云厂商已有采购和权限体系的团队来说,这会减少不少落地阻力。
不过,API 迁移不能只把模型名从旧 ID 改成 claude-opus-5。有几个参数要认真看。
首先是 max_tokens。Opus 5 默认开启 thinking,思考过程会消耗输出 token。如果你沿用过去很紧的输出上限,可能会出现回答被截断、结构不完整、成本预估偏差等问题。
其次是 effort 档位。xhigh/max 档位不能关闭 thinking,关闭会返回 400 错误。也就是说,如果你之前在路由层里硬编码了某些“关闭思考”的策略,迁移后要测一遍。
更稳妥的做法是先小流量验证:
| 检查项 | 为什么要测 |
|---|---|
max_tokens |
thinking 会占用输出预算 |
| thinking 开关 | 高 effort 档位不能随意关闭 |
| effort 档位 | 不同任务的质量、速度、成本差异明显 |
| Fast 模式 | 速度更快,但计费和质量表现要实测 |
| 路由策略 | Sonnet、Opus 5、Fable 5 的分工可能变化 |
| 失败回退 | 安全分类器或参数错误可能触发回退逻辑 |
安全策略方面,Anthropic 称 Opus 5 在自动化行为审计中失准行为得分较低,欺骗性行为比例最低。被安全分类器标记的请求,可以回退至 Opus 4.8 或其他模型。企业用户如果有严格的审计和合规要求,需要把这类回退路径写进系统设计里,而不是上线后临时处理。
还有一个很现实的用户体验问题:账号稳定性。早期创作者实测中,多次提到 Claude 登录、封号或使用受限带来的不确定性。这个问题不影响 Opus 5 的模型能力判断,却会影响个人用户是否值得立即订阅。模型再强,如果账号无法稳定使用,体验就会打折。API 用户相对可控,但也要确认地区接入、计费方式和团队权限。
默认模型该不该换成 Opus 5?
如果你已经是 Claude Max 用户,Opus 5 成为默认模型,直接拿它跑过去的复杂任务即可。别从简单提示开始测。简单任务很难拉开差距。拿那些过去让 Sonnet 卡住、让 Opus 4.8 成本偏高、让 Fable 5 又显得太贵的任务。
Claude Pro 用户也值得关注。Opus 5 是 Pro 用户可使用的最强模型,这意味着一些过去只能靠更高档位模型完成的复杂任务,现在有了更便宜的入口。
API 用户要更克制。不要一夜之间把全部高难任务切到 Opus 5。比较好的做法是分三步:
- 选 20 到 50 个历史复杂任务,覆盖编码、长文档、Agent、数值推理等类型;
- 用 Sonnet 5、Opus 4.8、Opus 5、Fable 5 在相同输入下做对比;
- 记录成功率、人工修改次数、总 token、墙钟时间和失败原因。
只看单次输出质量不够。很多模型第一次回答都不错,差距出现在第二轮、第三轮,出现在工具失败后的恢复能力,出现在复杂上下文里的细节保持。
可以给一个简单的路由建议:
| 任务类型 | 推荐起点 |
|---|---|
| 简单分类、摘要、格式转换 | Haiku 4.5 |
| 日常写作、普通代码、常规问答 | Sonnet 5 |
| 跨文件工程、Agent、长文档研究 | Opus 5 |
| 极高难度推理、Opus 5 多次失败任务 | Fable 5 |
| 成本敏感的大批量离线任务 | Batch API + 分层路由 |
这套路由的变化在于,Opus 5 接过了许多过去会直接交给 Fable 5 的任务。它不一定每次都赢 Fable 5,但如果质量接近、成本只有一半,默认选择就会改变。
Opus 5 的意义:把“够强且够便宜”推到复杂任务里
Claude Opus 5 不是一个只靠榜单存在的模型。它更像 Anthropic 给复杂任务市场的一次价格重排。
它维持 Opus 4.8 的价格,能力逼近 Fable 5,并把自我校验、工具使用、稳定输出这些更贴近生产环境的能力往前推了一步。对开发团队、Agent 构建者、企业自动化用户来说,这比单纯刷新某个跑分更有用。
当然,现在还不能把它神化。官方数据很亮眼,早期实测也显示出强势表现,但第三方复测和更大规模生产验证仍然必要。账号可用性、地区接入、API 参数迁移、thinking 成本、effort 档位,都会影响最后的使用体验。
如果你已经有 Claude 订阅,可以拿过去真正难住模型的任务重新测一遍。让它修一个旧 bug,改一个多文件模块,读一份长文档,或者跑一个带验证环节的 Agent 流程。不要只看它说得好不好,要看它能不能少犯错、少返工、少浪费 token。
如果你是 API 用户,先小流量接入。把 thinking、max_tokens、effort、Fast 模式和回退策略测清楚,再扩大使用。
Opus 5 最值得关注的地方,不是它是不是 Anthropic 最强模型,而是它让“复杂任务默认交给更强模型”这件事变得更划算了。