9 月 22 日,Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 GPT-6 Luna。三款模型挤在同一个时间窗口出现,重点都很明显:让长任务、编码 Agent 和知识工作变得更便宜。
这次不适合只看“谁的榜单第一”。真正会影响开发者预算的,是每完成一个任务要消耗多少输入、输出和推理成本。

三款模型先放在一张表里
| 模型 | 官方定位 | 公开 API 价格(输入 / 输出,每百万 token) | 主要入口 |
|---|---|---|---|
| Claude Opus 5.5 | 长时间 Agent 编程、知识工作 | $4 / $20 | Claude API、云平台等 |
| GPT-6 Sol | 能力与成本的平衡 | $2 / $10 | API、Codex、ChatGPT Work |
| GPT-6 Luna | 更低成本、高频调用 | $0.10 / $0.50 | API、部分 ChatGPT 入口 |
价格表只能说明单价,不能直接等同于一次任务的最终账单。实际成本还会受上下文长度、缓存命中、工具调用次数、输出长度和推理档位影响。

Anthropic 的 40% 和 API 标价不是一回事
Anthropic 表示,Opus 5.5 在多数任务上达到 Fable 5.1 水平,运行成本比 Opus 5 低约 40%。公开 API 价格是输入 $4、输出 $20 / 百万 token。
这两个数字不能直接相加解释:
- 40% 更接近典型任务的运行成本变化;
- $4/$20 是 API 的输入输出标价;
- 缓存读取、推理档位和实际输出长度会改变任务成本;
- 同一个模型在 Claude Code 和直接 API 中,计费结构可能不同。
如果读者只看“便宜 40%”,容易误以为每个 API 请求都自动少收 40%。正确做法是拿自己的任务日志计算,不要用宣传数字代替账单。
OpenAI 把 Sol 和 Luna 放在中间档
OpenAI 的产品分层更清楚:Astra 负责最高能力,Sol 负责能力与成本平衡,Luna 负责低价和大规模调用。
OpenAI Developers 公布的方向包括:
- Sol 和 Luna 的 API 价格比 GPT-5.6 低约 50%;
- Sol 和 Luna 将进入 Codex 和 ChatGPT Work;
- DeepSWE 测试中,Sol 的成本明显低于 Fable 5;
- Luna 更像是批量任务和简单工作流的低价选项;
- 改进的 prompt caching 用于减少 Agent 的重复处理。
独立测试仍需要单独看。Artificial Analysis 的资料显示,Sol 的 Coding Agent Index 有提升,Luna 的分数反而有回落。低价不代表所有任务都更强。

开发者应该怎么分配任务
可以先按任务风险和重复程度分四类:
| 任务 | 优先考虑 | 原因 |
|---|---|---|
| 复杂架构设计、关键决策 | Opus 5.5 或 Astra | 错误成本高,值得用更强模型复核 |
| 多文件编码和长时间 Agent | Sol、Opus 5.5 | 需要能力与运行成本平衡 |
| 批量分类、摘要、格式转换 | Luna | 任务重复度高,单次价值有限 |
| 有明确规则的自动化流程 | Luna 先跑,抽样用 Sol 复核 | 降低整体成本,同时保留质量检查 |
不要一上来把全部任务迁移到最低价模型。先拿一批已有输入做 A/B 测试,记录成功率、人工返工时间和总 token,再决定是否切换。
一个便宜模型如果每十次要人工重做三次,最后成本可能高于使用更贵的模型一次完成。
为什么这次更像价格战
过去的模型发布通常围绕更大的上下文、更高的榜单分数或新的模态。现在三款模型的发布都在强调另一件事:Agent 会持续调用模型,开发者更关心一条完整任务链的总成本。
一次 Agent 任务可能包括:
- 读取仓库和历史上下文;
- 规划步骤;
- 多次调用工具;
- 运行测试并修复错误;
- 总结结果并生成文件。
单次对话价格并不高,但长链路会把输入、输出和工具调用放大。缓存和低价模型因此比单次 benchmark 分数更接近生产问题。
ChatGPT 用户和 API 用户不要混为一谈
GPT-6 Sol 和 Luna 的发布入口并不完全相同。API 用户可以按模型 ID 申请调用,Codex 和 ChatGPT Work 则按订阅和账号逐步开放。普通 ChatGPT 对话界面不一定同时显示这两款模型。
Opus 5.5 也存在平台差异:Claude、Anthropic API、Amazon Web Services、Google Cloud 和 Microsoft Azure 的开放时间、模型别名和计费规则可能不同。
看到“模型已发布”,不等于你的账号已经可以直接使用。进入生产前要核对:
- 模型 ID;
- API 区域和权限;
- 输入输出价格;
- 缓存价格;
- 最大上下文和最大输出;
- 是否允许工具调用和批量请求。
一套低风险迁移方法
如果你已经在使用 GPT-6 Astra、GPT-5.6 或 Opus 5,可以这样测试:
- 选取一批已经完成、结果可评分的真实任务。
- 把输入、工具权限和输出格式固定下来。
- 分别运行旧模型和新模型,不同时修改提示词。
- 记录 API 花费、耗时、失败次数和人工返工时间。
- 先把低风险重复任务切到 Luna 或 Sol。
- 复杂任务继续使用强模型,并让低价模型做草稿或预处理。
不要只看每百万 token 的价格。最终应该比较“完成一个合格任务的总成本”。
站内已有的 Grok 4.7 API 价格对比 适合和这篇放在一起看。生产环境仍要保留官方 API 和故障回退,不要把单一模型当成唯一入口。
结论:先算任务成本,再选模型
这轮发布的信号很清楚:模型能力仍在竞争,但 Agent 的普及让成本成为同等重要的指标。
Opus 5.5 更像是能力和成本的重新平衡,GPT-6 Sol 更适合把中高难度任务放进生产,Luna 则把大量简单调用的价格压到很低。最终选择不该由型号大小决定,而应该由任务失败代价、重复次数和人工复核成本决定。
来源
- Anthropic:Claude Opus 5.5
- Anthropic API 更新
- OpenAI:GPT-6 Sol 和 Luna
- Artificial Analysis:GPT-6 Sol 和 Luna 成本效率分析
模型价格、开放范围和能力会变化。本文仅作技术信息整理,不构成模型采购或业务架构建议。