🎯 Claude Fable 5.1已经正式发布,API模型ID为
claude-fable-5-1。它在编码、长任务和科研评测上明显增强,缓存读取降价75%;普通输入与输出维持原价,高努力档的单任务费用甚至可能高于Fable 5。

📌 Fable 5.1正式改变了什么
Anthropic在2026年9月1日发布Claude Fable 5.1与Claude Mythos 5.1 。两者使用相同的底层模型,区别在于安全控制和开放范围。
| 项目 | Claude Fable 5.1 | Claude Mythos 5.1 |
|---|---|---|
| 定位 | 面向普通用户和企业的公开版本 | 面向受审查机构的受限版本 |
| API模型ID | claude-fable-5-1 | claude-mythos-5-1 |
| 核心能力 | 编码、长任务、知识工作、科研 | 同一底层能力,放宽部分高风险领域限制 |
| 上下文窗口 | 100万Token | 100万Token |
| 最大输出 | 12.8万Token | 12.8万Token |
| 思考模式 | 自适应思考始终开启 | 自适应思考始终开启 |
| 开放范围 | Claude API及主要云平台 | 目前主要限于获批的美国机构 |
Fable 5.1处于Anthropic产品线的高端位置,适合长时间运行的编码Agent、复杂研究和多工具工作流。普通问答、简单改写或高并发分类任务,Sonnet、Haiku或其他低价模型通常更合适。
📊 跑分提升集中在哪些任务
Anthropic公布的测试显示,Fable 5.1最大的提升集中在长任务、科研Agent和终端操作,各类评测的增幅差异明显。
| 评测 | Fable 5 | Opus 5 | Fable 5.1 | Mythos 5.1 |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 24.7% | 29.0% | 52.6% | 未单列 |
| Terminal-Bench 4.0 | 42.0% | 52.3% | 55.8% | 60.9% |
| CursorBench 3.2.0 | 70.5% | 接近Fable 5 | 73.4% | 未单列 |
| Humanity's Last Exam(无工具) | 57.8% | 未单列 | 60.9% | 未单列 |
这些数字说明两件事:
- 科研与长链路任务提升最明显,短任务的增幅需要单独测试。
- Fable与Mythos的安全策略会影响部分测试,跨厂商排名需要同时核对测试框架、努力档位和工具配置。
第三方评测机构Artificial Analysis把Fable 5.1高努力版本排在其智能指数前列。公开排行榜适合筛选候选模型,团队仍需使用自己的代码库、工具调用和失败重试流程验证。
💰 缓存降价,基础价格不变
Fable 5.1延续Fable 5的基础价格,真正变化的是缓存读取。
| 计费项目 | 每100万Token价格 |
|---|---|
| 普通输入 | 10美元 |
| 5分钟缓存写入 | 12.50美元 |
| 1小时缓存写入 | 20美元 |
| 缓存读取与刷新 | 0.25美元 |
| 输出Token | 50美元 |
Fable 5原来的缓存读取价格是每100万Token 1美元,Fable 5.1降至0.25美元。Anthropic根据2026年8月的实际用量估算:一般工作负载成本约下降25%,缓存占比较高的Agent任务最多可下降约45%。这些比例来自特定工作负载,每次请求的实际折扣取决于缓存命中率与输出量。

以20万Token代码库为例:
- 首次写入5分钟缓存约2.50美元;
- 每次读取完整缓存约0.05美元;
- 后续读取20次合计约1美元;
- 若20次都按普通输入重新发送,同一部分输入约需40美元。
这个例子只计算输入,不包含新增上下文、思考Token、工具返回和最终输出。Fable 5.1的输出仍按每100万Token 50美元计费。Agent反复生成长代码、长报告或大量隐式思考时,输出很可能重新成为最大成本项。
⚖️ 为什么降价后单任务反而可能更贵
Artificial Analysis的发布测试给出了一个看似矛盾的结果:Fable 5.1 Max完成其智能指数任务的成本约为3.76美元,比Fable 5 Max的3.14美元高约20%。
两组数字测量的是不同场景,因而给出不同成本结论:
| 差异 | Anthropic成本估算 | Artificial Analysis测试 |
|---|---|---|
| 数据来源 | 真实产品用量样本 | 固定评测任务 |
| 努力档位 | 默认努力档 | Max高努力档 |
| 缓存占比 | 代码库和长会话可大量复用 | 单次评测复用较少 |
| 输出长度 | 随真实任务变化 | 新模型可能生成更多推理与输出 |
| 衡量目标 | 相同工作负载总费用 | 完成一组基准任务的成本 |
判断是否便宜,需要观察完整价格表和真实任务。更实用的指标是:
单个成功任务成本
= 普通输入
+ 缓存写入与读取
+ 思考及可见输出
+ 工具调用
+ 失败重试
+ 人工返工
如果Fable 5.1一次完成、旧模型要重试三次,新模型即使单次贵也可能更省。反过来,任务本身简单、上下文无法复用,Fable 5.1的高输出单价就很难被缓存优惠抵消。
🛠️ API迁移前要改哪些配置
开发者还需要处理模型名之外的行为差异。根据Anthropic当前模型迁移说明 ,Fable 5.1有几项配置需要提前调整。
1. 删除手动思考预算
Fable 5.1使用始终开启的自适应思考,不接受旧式手动Token预算:
{
"thinking": {
"type": "enabled",
"budget_tokens": 16000
}
}
上面的配置会返回400错误。迁移后应移除budget_tokens,通过effort控制任务投入程度。把thinking设为disabled同样会报错。
2. 改造Assistant Prefill工作流
Fable 5.1不支持预填Assistant消息。依赖“先写半段JSON,再让模型续写”的旧工作流,需要改成Schema约束、工具参数或更明确的输出指令。
3. 重新设置最大输出
思考Token按输出价格计费,并与可见回答共同占用max_tokens。旧模型上够用的上限,迁移后可能过早截断;直接把上限拉满,又可能放大费用。应按真实任务记录P50、P95输出量后再设限。
4. 检查数据保留和安全回退
Anthropic同时推出Enterprise Frontier Safeguards,让企业把监控数据保存在自己控制的云环境中。正式部署前仍要确认账户的数据保留资格、地区、云平台配置和高风险请求的回退行为。
安全分类器对网络安全、生命科学等请求可能采取阻止或切换处理路径。同一个模型名称下,具体请求仍可能进入不同的能力层。
📋 是否值得迁移
| 工作负载 | 迁移判断 |
|---|---|
| 大型代码库、上下文反复复用 | 优先小规模测试,缓存降价可能很有价值 |
| 长时间运行、多工具Agent | 重点比较成功率、重试次数和总输出成本 |
| 科研检索、复杂数据分析 | 能力提升明显,需要同时确认领域安全限制 |
| 简单问答、翻译、分类 | 低价模型通常更合适 |
| 一次性长报告 | 缓存收益有限,先估算输出Token |
| 高风险网络安全任务 | 公开版可能触发限制,应与Mythos分开评估 |
推荐用20至50个真实任务做A/B测试,至少记录完成率、首Token延迟、总耗时、缓存命中量、输入输出Token、工具失败、重试次数和人工修改时间。
需要在不同模型之间保留回退路径,可参考站内的9Router多模型网关指南 和Cursor模型供应风险分析 。需要补充独立API上游时,可查看APIMart模型入口 ;第三方聚合服务仍需单独核对真实上游、日志、价格和数据条款。
Fable 5.1最适合处理旧模型完成率低、返工次数多的高价值任务。排行榜只负责提供候选模型,默认路由应依据成功任务成本决定。