🎯 GPT-6 Astra与Claude Fable 5.1的基础输入、输出价格都是每百万Token 10美元和50美元。缓存读取分别为1美元和0.25美元,相差4倍。Agent反复读取同一仓库时,这一行会逐渐压过模型标价。

Astra与Claude Fable 5.1缓存成本对比

两个模型的首页价格看起来完全相同。短对话的费用也几乎一样。差距会在长代码库、多轮工具调用和重复读取系统上下文时出现。

社区里流传的“缓存贵8倍”缺少统一比较口径。按两家当前官方API价格,Astra与Fable 5.1的缓存读取差距是4倍。云平台、区域推理和其他模型组合可能产生更大差距,需要单独列账。


📌 官方价格放到同一张表

OpenAI的Astra模型页 和Anthropic的Fable 5.1发布说明 给出了当前公开价格。

每100万TokenGPT-6 AstraClaude Fable 5.1
普通输入$10.00$10.00
5分钟缓存写入$12.50$12.50
1小时缓存写入以OpenAI当前缓存规则为准$20.00
缓存读取$1.00$0.25
输出$50.00$50.00

Fable 5.1把缓存读取降到了基础输入价的2.5%。Anthropic称,相比Fable 5,典型工作负载成本约下降25%,复杂编码和高度Agent化任务最多可下降约45%。这些比例来自其2026年8月实际用量样本,具体账单仍由缓存命中率和输出长度决定。

Astra缓存写入按普通输入的1.25倍计费。缓存读取是普通输入的10%,属于OpenAI当前公开费率。


🧮 三种负载怎么算

统一公式如下:

总成本 = 普通输入Token × 输入单价
       + 缓存写入Token × 写入单价
       + 缓存读取Token × 读取单价
       + 输出Token × 输出单价

所有Token先除以1,000,000,再乘表中单价。以下示例只比较Token费用,工具调用、失败重试、区域加价和长上下文附加费另算。

短对话、20轮Agent与200轮重读的账单对比

场景假设AstraFable 5.1
短对话20k普通输入 + 2k输出$0.30$0.30
20轮代码Agent200k缓存写入1次 + 20次完整缓存读取 + 每轮5k输出$11.50$8.50
200轮反复重读200k缓存写入1次 + 200次完整缓存读取 + 每轮1k输出$52.50$22.50

第二个场景的计算过程:

缓存写入:0.2M × $12.50 = $2.50
20次读取:4M × 缓存读取单价
输出:0.1M × $50 = $5.00

Astra = $2.50 + $4.00 + $5.00 = $11.50
Fable = $2.50 + $1.00 + $5.00 = $8.50

200轮示例里,Astra总费用约为Fable 5.1的2.33倍。缓存这一行单独看是4倍,输出费用相同,因此总账单不会机械地放大4倍。


🧱 长上下文会再改一次账

Astra支持1,050,000 Token上下文。官方规则写明,单次请求输入超过272k Token后,整次请求使用以下费率:

  • 输入与缓存费率:2倍;
  • 输出费率:1.5倍;
  • 加价覆盖整次请求,并非只计算超过272k的部分。

假设一次请求包含300k普通输入和10k输出:

基础费率:0.3M × $10 + 0.01M × $50 = $3.50
Astra长上下文费率:0.3M × $20 + 0.01M × $75 = $6.75

这使“把整个仓库一次塞进去”成为昂贵方案。检索、分层摘要、文件选择和稳定缓存前缀,通常更适合长期运行的Agent。

Fable 5.1同样提供百万Token级上下文,实际费用要结合Anthropic当前模型页、缓存时长、区域推理和所用云平台核算。AWS、Google Cloud、Microsoft Foundry与直连API还可能存在结算差异。


⚙️ 哪类任务更吃缓存

缓存价值取决于重复前缀规模与命中次数。

工作负载缓存占比倾向重点观察
单轮问答输出长度与基础输入价
客服多轮会话系统提示和知识库前缀能否稳定
长仓库编码仓库索引、工具定义、历史记录重读
多Agent协作每个Agent是否重复加载相同上下文
批处理抽取中至高共享模板与参考资料的命中率

以下变化会让缓存失效或收益下降:

  1. 每轮都改写系统提示;
  2. 工具定义顺序频繁变化;
  3. 把动态时间戳放进缓存前缀;
  4. 缓存生命周期短于任务间隔;
  5. 每个子Agent重新拼装整套上下文。

工程上应把稳定内容放前面,把用户输入、时间和实时工具结果放后面。缓存命中率需要从账单或用量字段读取,不能凭请求次数猜。


📋 选模型先做一张成本表

模型评测回答“能不能完成”,成本表回答“能不能持续运行”。建议给每类真实任务记录以下字段:

workload: repo-agent
runs: 50
base_context_tokens: 200000
uncached_input_tokens: 180000
cache_write_tokens: 200000
cache_read_tokens: 7600000
output_tokens: 240000
retry_count: 6
tool_calls: 410
human_review_minutes: 95

把同一批任务分别跑在两个模型上,再比较:

  • 首次成功率;
  • 总Token成本;
  • 缓存命中率;
  • 工具调用费;
  • 重试次数;
  • 人工复核时间。

需要统一记录多家模型的调用和回退,可参考站内的9Router多模型网关指南 。补充独立API线路可查看APIMart模型入口 ,计费仍以实际上游账单为准。


❓ FAQ

两个模型的基础价格真的一样吗?

当前公开API价格均为每百万Token输入10美元、输出50美元。缓存、长上下文、区域推理和工具调用规则存在差异。

Fable 5.1缓存为什么便宜?

Anthropic把缓存读取价格降到每百万Token 0.25美元,即基础输入价的2.5%。5分钟缓存写入仍为12.50美元。

Astra缓存贵8倍的说法准确吗?

按当前官方缓存读取价格,Astra的1美元是Fable 5.1的0.25美元的4倍。8倍需要额外比较条件,不能直接套用到所有API请求。

Agent轮数越多,Fable一定越便宜吗?

缓存重读占比越高,Fable 5.1的费率优势越明显。模型成功率、输出长度、重试和工具费用也会改变总成本。

怎么避免272k以上的Astra加价?

用文件检索、分层上下文、稳定缓存前缀和任务拆分控制单次输入。拆分后仍要保留足够依赖信息,避免因上下文缺失增加重试。