同一天,两家公司都在告诉开发者一件事:

更强已经不够了,下一轮模型战争要开始比“完成同一个任务到底花多少钱”。

9 月 22 日,Anthropic 推出 Claude Opus 5.5。官方称,它在多数工作上的能力接近 Claude Fable 5.1,同时典型工作负载相较 Opus 5 可降低约 40% 的运行成本。

几乎同一时间,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,把 GPT-6 系列能力向更低成本档位下放。

表面上,这是又一次模型发布撞车。但如果你正在使用 Claude Code、Codex、Coding Agent,或者每天都在大量烧 API,这次真正应该看的已经不是 Benchmark 第一名是谁。

以前大家比谁最聪明,现在开始比谁能用更低成本真正把任务做完。

Opus 5.5:降的不只是 Token 单价

模型价格战从跑分转向任务成本

Claude Opus 5.5 的 API 定价是:

  • 输入:$4 / 1M tokens
  • 输出:$20 / 1M tokens

相比 Opus 5,标价下降约 20%。但 Anthropic 强调的是:在典型工作负载下,实际运行成本可以降低约 40%。

因为 Agent 真正的成本不是简单的 Token 单价,而是:

模型价格 × Token 消耗 × 工具调用 × 重试次数 + 人工返工

如果模型少绕一次路、少改坏一次代码、少跑两轮测试,最终任务成本可能下降得更多。

OpenAI:把 Sol 压到 $2 / $10

Opus 5.5 与 GPT-6 Sol 的输入输出价格对比

GPT-6 Sol 的 API 定价为:

  • 输入:$2 / 1M tokens
  • 输出:$10 / 1M tokens

GPT-6 Luna 更低:

  • 输入:$0.10 / 1M tokens
  • 输出:$0.50 / 1M tokens

这时候 GPT-6 产品线的打法已经很清楚:

简单任务 → Luna

普通复杂任务 / 日常 Agent → Sol

真正困难任务 → Astra

为什么不能只看 Benchmark?

GPT-6 按任务难度分为 Luna、Sol、Astra

真正让 Coding Agent 连续跑一天,更重要的是:

  • 第一次有没有理解对需求;
  • 会不会把正常代码改坏;
  • 工具调用是否稳定;
  • 报错以后能不能自己恢复;
  • 长任务会不会忘记约束;
  • 最终需要多少人工修改;
  • 完成一次任务总共烧掉多少 Token。

以后更应该关注:

Cost per completed task——每成功完成一个任务的真实成本。

一个模型便宜 50%,但同一个任务需要跑三遍,它未必便宜。

现在该不该换模型?

不要看到新模型就全量切换。

从自己的真实任务中抽 30–100 个:

Claude Opus 5.5 vs GPT-6 Sol vs 当前生产模型

记录:

  1. 一次成功率
  2. 总 Token
  3. 完成时间
  4. 重试次数
  5. 人工介入时间

最后计算:

真实任务成本 = API 成本 + 失败重试 + 人工返工

这个结果比网上任何排行榜更适合决定默认模型。

真实任务成本由 Token、重试、时间和人工返工组成

结论

这轮发布最值得记住的,不是谁暂时坐上第一,而是 Anthropic 和 OpenAI 都开始把“更便宜”摆到核心位置。

过去前沿 AI 的故事是“我比上一代聪明多少”。

现在正在变成:

我能不能用更少的钱把同一件事做完。

Agent 时代真正的模型价格战,才刚开始。