🎯 GPT-6 Astra与Claude Fable 5.1的基础输入、输出价格都是每百万Token 10美元和50美元。缓存读取分别为1美元和0.25美元,相差4倍。Agent反复读取同一仓库时,这一行会逐渐压过模型标价。

两个模型的首页价格看起来完全相同。短对话的费用也几乎一样。差距会在长代码库、多轮工具调用和重复读取系统上下文时出现。
社区里流传的“缓存贵8倍”缺少统一比较口径。按两家当前官方API价格,Astra与Fable 5.1的缓存读取差距是4倍。云平台、区域推理和其他模型组合可能产生更大差距,需要单独列账。
📌 官方价格放到同一张表
OpenAI的Astra模型页 和Anthropic的Fable 5.1发布说明 给出了当前公开价格。
| 每100万Token | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| 普通输入 | $10.00 | $10.00 |
| 5分钟缓存写入 | $12.50 | $12.50 |
| 1小时缓存写入 | 以OpenAI当前缓存规则为准 | $20.00 |
| 缓存读取 | $1.00 | $0.25 |
| 输出 | $50.00 | $50.00 |
Fable 5.1把缓存读取降到了基础输入价的2.5%。Anthropic称,相比Fable 5,典型工作负载成本约下降25%,复杂编码和高度Agent化任务最多可下降约45%。这些比例来自其2026年8月实际用量样本,具体账单仍由缓存命中率和输出长度决定。
Astra缓存写入按普通输入的1.25倍计费。缓存读取是普通输入的10%,属于OpenAI当前公开费率。
🧮 三种负载怎么算
统一公式如下:
总成本 = 普通输入Token × 输入单价
+ 缓存写入Token × 写入单价
+ 缓存读取Token × 读取单价
+ 输出Token × 输出单价
所有Token先除以1,000,000,再乘表中单价。以下示例只比较Token费用,工具调用、失败重试、区域加价和长上下文附加费另算。

| 场景 | 假设 | Astra | Fable 5.1 |
|---|---|---|---|
| 短对话 | 20k普通输入 + 2k输出 | $0.30 | $0.30 |
| 20轮代码Agent | 200k缓存写入1次 + 20次完整缓存读取 + 每轮5k输出 | $11.50 | $8.50 |
| 200轮反复重读 | 200k缓存写入1次 + 200次完整缓存读取 + 每轮1k输出 | $52.50 | $22.50 |
第二个场景的计算过程:
缓存写入:0.2M × $12.50 = $2.50
20次读取:4M × 缓存读取单价
输出:0.1M × $50 = $5.00
Astra = $2.50 + $4.00 + $5.00 = $11.50
Fable = $2.50 + $1.00 + $5.00 = $8.50
200轮示例里,Astra总费用约为Fable 5.1的2.33倍。缓存这一行单独看是4倍,输出费用相同,因此总账单不会机械地放大4倍。
🧱 长上下文会再改一次账
Astra支持1,050,000 Token上下文。官方规则写明,单次请求输入超过272k Token后,整次请求使用以下费率:
- 输入与缓存费率:2倍;
- 输出费率:1.5倍;
- 加价覆盖整次请求,并非只计算超过272k的部分。
假设一次请求包含300k普通输入和10k输出:
基础费率:0.3M × $10 + 0.01M × $50 = $3.50
Astra长上下文费率:0.3M × $20 + 0.01M × $75 = $6.75
这使“把整个仓库一次塞进去”成为昂贵方案。检索、分层摘要、文件选择和稳定缓存前缀,通常更适合长期运行的Agent。
Fable 5.1同样提供百万Token级上下文,实际费用要结合Anthropic当前模型页、缓存时长、区域推理和所用云平台核算。AWS、Google Cloud、Microsoft Foundry与直连API还可能存在结算差异。
⚙️ 哪类任务更吃缓存
缓存价值取决于重复前缀规模与命中次数。
| 工作负载 | 缓存占比倾向 | 重点观察 |
|---|---|---|
| 单轮问答 | 低 | 输出长度与基础输入价 |
| 客服多轮会话 | 中 | 系统提示和知识库前缀能否稳定 |
| 长仓库编码 | 高 | 仓库索引、工具定义、历史记录重读 |
| 多Agent协作 | 高 | 每个Agent是否重复加载相同上下文 |
| 批处理抽取 | 中至高 | 共享模板与参考资料的命中率 |
以下变化会让缓存失效或收益下降:
- 每轮都改写系统提示;
- 工具定义顺序频繁变化;
- 把动态时间戳放进缓存前缀;
- 缓存生命周期短于任务间隔;
- 每个子Agent重新拼装整套上下文。
工程上应把稳定内容放前面,把用户输入、时间和实时工具结果放后面。缓存命中率需要从账单或用量字段读取,不能凭请求次数猜。
📋 选模型先做一张成本表
模型评测回答“能不能完成”,成本表回答“能不能持续运行”。建议给每类真实任务记录以下字段:
workload: repo-agent
runs: 50
base_context_tokens: 200000
uncached_input_tokens: 180000
cache_write_tokens: 200000
cache_read_tokens: 7600000
output_tokens: 240000
retry_count: 6
tool_calls: 410
human_review_minutes: 95
把同一批任务分别跑在两个模型上,再比较:
- 首次成功率;
- 总Token成本;
- 缓存命中率;
- 工具调用费;
- 重试次数;
- 人工复核时间。
需要统一记录多家模型的调用和回退,可参考站内的9Router多模型网关指南 。补充独立API线路可查看APIMart模型入口 ,计费仍以实际上游账单为准。
❓ FAQ
两个模型的基础价格真的一样吗?
当前公开API价格均为每百万Token输入10美元、输出50美元。缓存、长上下文、区域推理和工具调用规则存在差异。
Fable 5.1缓存为什么便宜?
Anthropic把缓存读取价格降到每百万Token 0.25美元,即基础输入价的2.5%。5分钟缓存写入仍为12.50美元。
Astra缓存贵8倍的说法准确吗?
按当前官方缓存读取价格,Astra的1美元是Fable 5.1的0.25美元的4倍。8倍需要额外比较条件,不能直接套用到所有API请求。
Agent轮数越多,Fable一定越便宜吗?
缓存重读占比越高,Fable 5.1的费率优势越明显。模型成功率、输出长度、重试和工具费用也会改变总成本。
怎么避免272k以上的Astra加价?
用文件检索、分层上下文、稳定缓存前缀和任务拆分控制单次输入。拆分后仍要保留足够依赖信息,避免因上下文缺失增加重试。
