Claude Fable 5.1 与 Mythos 5.1:长程智能体提升,降本关键在缓存
Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1 与 Mythos 5.1。两者采用相同基础模型,但面向不同安全边界;Fable 5.1 的能力提升集中在长程智能体任务,实际降本主要来自缓存读取价格下降。
Anthropic 于当地时间 2026 年 9 月 1 日宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,并将它们定位为面向编程和知识工作的先进模型。两款模型同时出现,容易让人先想到“标准版”和“高配版”,但这个理解并不准确。
Fable 5.1 与 Mythos 5.1 采用相同的基础模型,差异主要在安全防护、准入对象和可处理任务边界。Fable 5.1 是公开可用版本,已经进入 Claude API、Claude 产品,以及 Amazon Web Services 或 Amazon Bedrock、Google Cloud、Microsoft Azure 等云平台渠道。据发布资料,API 模型标识符为 claude-fable-5-1。
Mythos 5.1 则通过验证或可信访问计划开放,主要面向经过审核的网络安全和生命科学机构。多篇发布信息显示,当前开放对象限于经过审核的美国组织。它不能简单理解为“没有审查的 Fable”,更准确的说法是:同一个基础模型在敏感专业领域使用了经过调整的安全机制,同时保留机构审核和用途约束。
这套双轨设计决定了这次更新的观察重点。它不只是把一个模型换成更高分的版本,还试图同时处理长周期任务的能力、公开版本的使用体验、缓存成本,以及专业场景中的风险边界。
能力提升集中在终端和长周期任务
Fable 5.1 的跑分变化并不平均。科学终端、自动化和软件工程相关任务提升更明显,部分纯知识或纯推理测试的变化则相对温和。
以下数据来自 Anthropic 公布的测试或比较结果。不同基准的任务类型、工具条件和安全配置并不完全相同,不能把它们拼成一个“所有能力全面领先”的结论。
| 基准测试 | Fable 5 | Fable 5.1 | 其他对照 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 24.7% | 52.6% | Opus 5:29.0%;GPT-5.6 Sol:22.4% |
| Terminal-Bench 4.0 | 42.0% | 55.8% | Mythos 5.1:60.9% |
| AutomationBench | 17.1% | 31.4% | |
| CursorBench 3.2.0 | 70.5% | 73.4% | |
| OSWorld 2.0(部分测试) | 72.9% | 77.9% | |
| GDPval-AA v2 | 1723 | 1853 | Opus 5:1824 |
| Humanity's Last Exam(无工具) | 57.8% | 60.9% | Fable 5.1 搭配工具:65.0% |
Terminal-Bench-Science 0.1 是最醒目的例子。Fable 5.1 的成绩为 52.6%,Fable 5 为 24.7%。Terminal-Bench 4.0 中,Fable 5.1 从 42.0%升至 55.8%,采用不同安全配置的 Mythos 5.1 达到 60.9%。
但这里有一个容易混淆的数字:Humanity's Last Exam 的无工具成绩也是 60.9%,这与 Mythos 5.1 在 Terminal-Bench 4.0 中的 60.9%不是同一项测试,不能互相替换。
这些测试共同考察的,不是模型能否在一轮对话里给出漂亮答案,而是它能否在更长时间内完成一串动作:读取项目资料,拆分任务,调用终端或其他工具,检查执行结果,处理错误,再决定下一步怎么走。任务一旦包含多个环节,模型偶尔写错一行代码并不是最麻烦的事。更大的问题是它能否发现错误,并且不要在错误方向上继续走十几步。
Fable 5.1 在 AutomationBench 上从 17.1%升至 31.4%,也说明自动化任务可能是这次更新的重要受益场景。CursorBench 的提升则较小,从 70.5%升至 73.4%。这两组数据放在一起看,比单独强调某个榜单更有意义:Fable 5.1 的变化并非所有指标等比例上涨,长程执行和工具协作似乎比短流程代码补全更能体现差异。
科研案例展示了“执行链”变长
Anthropic 展示的几个科研和工程案例,重点不在模型一次生成了多少文字,而在于它能否把数据处理、代码编写、工具调用和结果检查连起来。
用雷达数据绘制金星高程图
据 Anthropic 介绍,Fable 5.1 使用 NASA Magellan(麦哲伦号)任务的雷达数据训练神经网络,并绘制了覆盖金星约三分之一区域的高分辨率高程地图。
此前相关地图的分辨率约为 10 至 20 公里,新的结果提升到约 2 至 3 公里。Anthropic 称,高程估计准确性最高提升 25%。
这类工作并不是“问模型一个科学问题,然后等待结论”。模型需要理解数据格式,准备训练流程,运行代码,查看中间结果,再根据结果调整方法。真正增加难度的地方,往往在于某一步出了问题以后,模型是否能定位问题,而不是盲目重新运行。
设计蛋白质结合剂
在生命科学方向,Anthropic 披露 Mythos 5.1 借助开源蛋白质设计和折叠工具设计结合剂,设计结果再接受外部湿实验验证。
据披露,在三个靶点上,结合亲和力达到 Adaptyv Bio 竞赛最佳方案的 10 倍;在 12 个靶点上,总体命中率接近 50%,对照的典型命中率为 10%至 15%。
这些数字不能直接当成完整科研结论。现有材料没有提供完整论文、样本量和复现实验细节,而且结果涉及外部湿实验。更稳妥的理解是,模型能够参与从候选设计到实验验证的流程,并在展示案例中取得了较好的结果。
为生物学模型编写 GPU 内核
另一个案例更接近工程优化。Mythos 5.1 为七个开源生物学深度学习模型编写自定义 GPU 内核,并缓存中间结果。Anthropic 称,最高提速 2.5 倍,预计可降低 30%至 60%的 GPU 成本。
这里的关键动作有两个:编写适配具体计算过程的内核,以及让重复出现的中间结果不必每次重新计算。后一个动作与 API 缓存降价其实属于同一类工程问题:当一个长流程反复使用相同输入或中间状态时,能否避免为相同内容重复付费。
找到长期未解决的崩溃根因
在编程案例中,Millennium 的测试涉及一个长期未解决的罕见崩溃问题。模型最终找到了根因,而不是只通过增加保护条件或隐藏错误日志来掩盖症状。
这个案例的价值在于问题的“长尾”特征。普通 Bug 往往能靠堆栈信息或一个稳定复现步骤解决,罕见崩溃则可能需要反复阅读代码、分析日志、构造假设、写测试,再回到原始问题检查。模型是否能在这些步骤之间保持上下文,决定了它究竟是在辅助排查,还是只是在生成看起来合理的修复建议。
这些案例都来自 Anthropic 或合作方的展示和陈述,不能等同于独立同行评审结果,也不能据此说模型已经可以独立承担科研责任。它们更适合说明:Fable 5.1 和 Mythos 5.1 的目标,是把模型放进一个持续运行的工作流,而不是只提升单轮回答的措辞质量。
基础 API 单价没有下降
“成本下降 25%”这个说法容易造成误读。Fable 5.1 的基础 API 价格与 Fable 5 相同:
- 输入:每百万 token 10 美元
- 输出:每百万 token 50 美元
- 缓存读取:每百万 token 0.25 美元
真正发生变化的是缓存读取价格。它从此前每百万 token 1 美元降至 0.25 美元,降幅为 75%。输入和输出单价并没有统一下降 25%。
Anthropic 按其披露的负载进行估算,典型工作负载的总成本约降低 25%;对于高度智能体化、需要反复读取上下文的负载,最高可能降低 45%。这两个比例都是估算结果,实际账单取决于缓存读取在总请求中的占比。
可以把不同成本因素简单拆开:
| 成本因素 | Fable 5.1 的变化 | 对实际账单的影响 |
|---|---|---|
| 首次输入 | 与 Fable 5 相同,每百万 token 10 美元 | 长度不变时没有直接降价 |
| 输出 | 与 Fable 5 相同,每百万 token 50 美元 | 输出越多,成本仍然越高 |
| 缓存读取 | 每百万 token 0.25 美元,下降 75% | 重复读取上下文的任务更受益 |
| 总成本 | Anthropic 估算典型负载约降 25% | 取决于缓存命中和任务结构 |
为什么长任务更容易受益?一个编码 Agent 可能连续工作很久,反复读取代码库、系统提示词、工具定义和此前的执行结果。科研 Agent 也可能在多轮实验中重复使用同一批数据说明和环境配置。只要这些上下文能够稳定缓存,后续读取的单价就会大幅下降。
短请求则未必有同等变化。一个只包含几千 token、没有重复上下文的问答请求,缓存读取在总账单中占比很低。即使缓存单价降了 75%,最终费用也不会自动减少 25%。
缓存是否命中,还与应用结构有关。每轮都重建一份提示词、随手修改系统指令,或者把动态日期和随机状态插入长上下文,都可能让原本稳定的前缀发生变化。对于智能体应用,缓存策略不是服务商账单上的一个小参数,而会影响提示词组织、上下文压缩和对话日志设计。
还要注意另一面:单步读取更便宜,不代表整个任务自然便宜。如果模型在高努力等级下创建大量子智能体,或者为了修复一个问题连续执行更多轮次,输出 token 和工具调用次数仍会增加。可以保留一句很朴素的提醒:不是只看它每一步多少钱,还要看它会走多少步。
五档努力等级让质量和预算可以调度
Fable 5.1 提供五档努力等级:Low、Medium、High、XHigh、Max。它们用于调节模型在回答前投入的推理资源,通常会同时影响成功率、延迟和 token 消耗。
视频素材称,Claude Code 默认使用 High,Claude Cowork 和 claude.ai 默认使用 Medium。具体产品默认值仍应以正式文档为准,不能把某个产品的默认配置当作 API 的永久规则。
实际使用中,不适合一律选择 Max。更可靠的方法是准备一组自己的任务,分别测试不同档位,并记录四项数据:
| 指标 | 需要观察的问题 |
|---|---|
| 成功率 | 任务是否真正完成,而不是只生成了代码 |
| 延迟 | 等待时间是否适合工作流 |
| 总 token | 包括重试、工具调用和子智能体消耗 |
| 人工返工 | 人需要修正多少次,能否顺利继续迭代 |
同名努力等级在不同型号上的计算投入也可能不同。Fable 5 的 High 不一定等于 Fable 5.1 的 High,因此旧模型的参数不能未经测试直接照搬。
提前测试者对 Fable 5.1 的反馈并不完全一致。有用户认为它比 Fable 5 更自然、更易读,也更适合人在环中的持续迭代。此前有人把 Fable 5 概括为“能力封顶,但相处难受”,而对 5.1 的描述则更接近“更自然、更听话、更容易看懂”。这属于用户体验反馈,不是量化结论。
同时,也有测试者指出,在需要连续八次工具调用的重复任务上,Fable 5.1 可能不如 Opus 5 稳定。这个反例很重要。长程智能体能力并不等于每一种长链路任务都更可靠,尤其是重复性强、工具调用规则固定的流程,应该单独测试。
API 迁移要重点核对工具调用和思考块
有关 API 兼容性的部分,目前主要来自一段视频对官方资料的转述。它适合列为迁移风险提醒,但在正式上线前应对照 Anthropic 官方 API 文档核验,不能直接当成适用于所有账号的操作手册。
视频称,Fable 5.1 不再接受把 tool_choice 设置为 any 或强制指定某个工具,相关请求可能返回 400。转述中给出的替代思路是使用 auto,配合严格的参数校验,并在提示词中明确要求模型调用工具。
其中一种可能解释是:模型的思考过程持续开启,强制跳过规划阶段可能导致推理内容进入工具参数,进而降低参数质量。但这只是对现象的解释,是否为官方确定的设计原因,仍需文档确认。
另一个需要关注的变化是 Thinking Block 与上下文的一致性。视频称,思考块可能同时绑定生成它的模型和精确上下文。修改此前消息、系统提示词或工具定义,可能使思考块失效或导致请求返回 400;旧模型回读新模型的思考块时,还可能静默丢弃。
这会影响三类集成:
- 根据任务动态切换模型的路由系统;
- 每轮请求都重建 System Prompt 的应用;
- 修改工具列表后继续复用原对话状态的工作流。
迁移时,应尽量让对话历史保持稳定并只追加内容,动态指令和上下文裁剪使用官方支持的机制,并在测试环境中观察思考块被丢弃、缓存未命中和 400 错误。
素材还提到 Thinking Binding Controls Beta 请求头、只追加式对话日志、中段 System Message、服务端上下文压缩和更严格的上下文检查等细节。这些具体名称、账号生效日期和参数行为,不能仅凭视频转录直接写成生产环境指令。尤其是有关 2026 年 8 月 31 日之后注册的 API 账号的说法,适用范围尚未得到多来源印证,接入前必须查看官方文档。
安全策略减少低风险误拦,但没有取消边界
安全策略的变化可以概括为两条线。
第一条线是减少正常请求的误拦截。Anthropic 称,Fable 5.1 在网络安全方向的误报数量较此前减少约 60%,可以协助发现用于防御目的的软件漏洞。在生物和医学方向,无害请求的过度拦截据称减少 85%。
第二条线是继续限制高风险用途。生成漏洞利用代码仍然受到限制,渗透测试和二进制漏洞扫描也仍有严格边界。现有材料没有充分说明每一类请求的具体处置机制,因此不宜断言所有请求都会被转交给某个特定型号。
Mythos 5.1 的准入方式也体现了这种取舍。更适合敏感领域的能力没有直接面向所有用户开放,而是放在验证访问和机构审核之下。对普通开发者来说,Mythos 5.1 不是可以随时购买的“更强套餐”。
企业数据处理方面,Anthropic 介绍了 Enterprise Frontier Safeguards。其核心安排是让客户数据保存在企业控制的云基础设施中,而不是 Anthropic 的系统中,并结合零数据保留和安全防护。该服务计划于 2026 年秋季分阶段推出,这是发布计划,不代表已经全面可用。
合规措施也在同步变化。Anthropic 于 2026 年 7 月签署欧盟《人工智能法案》有关 AI 生成内容透明度的实践准则。素材称,2026 年 8 月 2 日之后发布的模型输出需要加入不可见水印,Fable 5.1 已为生成文本加入该水印。
这种水印不包含用户或对话信息,也不影响输出内容和质量。相应的检测 API 仍处于私人预览阶段,计划向监管、执法、媒体和事实核查等符合条件的机构提供。
第三方实测能看出完成度,但不能替代评测
有视频作者设计了两个一次性全栈任务,用来比较 Fable 5.1 与 GPT-5.6 的实际生成结果。
第一个任务是在线 Excel。视频中的 Fable 5.1 版本支持拖选、乘法、求和、百分比、平均值、IF,以及除零错误处理。对照版本在部分小数、百分比和 IF 功能上没有完成。
第二个任务是仓库多机器人调度仿真。创建任务后,机器人能够取货并前往工作站;道路被拦截时,Fable 5.1 版本可以动态重新规划路线,同时保留任务队列和时间日志。
作者还称,让 GPT-5.6 生成约 100 个测试用例后对两个版本进行评分,Fable 5.1 的完成度约为 90 多分,对照版本约为 70 多分。
这些细节适合说明一次生成复杂前端和业务逻辑时的完成度,但不能写成 Fable 5.1 已经全面击败 GPT-5.6。测试没有充分公开完整提示词、模型参数、运行次数、随机性控制和可复现报告,且让参评模型同时担任评审,本身也可能引入偏差。视频作者还提到,第三方榜单尚未收录 Fable 5.1。
Devin、Every、Avery 等团队的迁移或使用量变化,也只能作为采用信号。比如“请求量增长 5 倍”可以说明某个团队增加了使用,但不能推导出模型质量提升了 5 倍。
用自己的任务集判断是否值得切换
Fable 5.1 最值得评估的任务,通常有几个共同特征:运行时间较长,需要反复读取大段上下文,包含多次工具调用,并且结果可以通过测试、实验或明确的验收条件来检查。
例如,复杂代码库的持续排错、需要运行多个脚本的终端任务、计算生物学中的批量实验流程,往往比一次性摘要或简单代码补全更容易体现它的优势。缓存读取价格下降,也只有在上下文反复复用时才会变成实际的成本优势。
选型时可以用两个问题筛选:
- 任务是否需要模型自主运行较长时间?
- 人是否会持续参与确认、修正和迭代?
长周期且上下文重复度高的任务,可以重点测试 Fable 5.1 的不同努力等级,并记录完整任务 token、缓存命中率、延迟、成功率和人工返工。短任务、重复工具链或高频人工确认场景,则不应因为“旗舰”标签直接切换,Opus 5 或较低努力等级可能在速度、成本或稳定性上更合适。
Mythos 5.1 的评估对象则更窄。它主要面向经过审核的网络安全和生命科学机构,普通开发者不应把它当作公开 API 的自然升级路径。
这次发布最值得关注的,不是基础 API 单价突然下降,也不是某一张排行榜上的单项数字,而是长程任务的能力、缓存经济性、交互可读性和安全准入被放在同一轮更新里处理。最终账单和使用体验,取决于任务能否少走弯路、少做重复工作,并在出现错误后继续沿着正确方向推进。模型每一步变便宜,不代表整项任务自然变便宜;真正决定成本的,是它要走多少步,以及这些步骤有多少能被缓存、验证和复用。