9 月 22 日,Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 GPT-6 Luna。三款模型挤在同一个时间窗口出现,重点都很明显:让长任务、编码 Agent 和知识工作变得更便宜。

这次不适合只看“谁的榜单第一”。真正会影响开发者预算的,是每完成一个任务要消耗多少输入、输出和推理成本。

两组抽象 AI 计算模块的对比示意图

三款模型先放在一张表里

模型官方定位公开 API 价格(输入 / 输出,每百万 token)主要入口
Claude Opus 5.5长时间 Agent 编程、知识工作$4 / $20Claude API、云平台等
GPT-6 Sol能力与成本的平衡$2 / $10API、Codex、ChatGPT Work
GPT-6 Luna更低成本、高频调用$0.10 / $0.50API、部分 ChatGPT 入口

价格表只能说明单价,不能直接等同于一次任务的最终账单。实际成本还会受上下文长度、缓存命中、工具调用次数、输出长度和推理档位影响。

抽象的模型成本下降阶梯

Anthropic 的 40% 和 API 标价不是一回事

Anthropic 表示,Opus 5.5 在多数任务上达到 Fable 5.1 水平,运行成本比 Opus 5 低约 40%。公开 API 价格是输入 $4、输出 $20 / 百万 token。

这两个数字不能直接相加解释:

  • 40% 更接近典型任务的运行成本变化;
  • $4/$20 是 API 的输入输出标价;
  • 缓存读取、推理档位和实际输出长度会改变任务成本;
  • 同一个模型在 Claude Code 和直接 API 中,计费结构可能不同。

如果读者只看“便宜 40%”,容易误以为每个 API 请求都自动少收 40%。正确做法是拿自己的任务日志计算,不要用宣传数字代替账单。

OpenAI 把 Sol 和 Luna 放在中间档

OpenAI 的产品分层更清楚:Astra 负责最高能力,Sol 负责能力与成本平衡,Luna 负责低价和大规模调用。

OpenAI Developers 公布的方向包括:

  • Sol 和 Luna 的 API 价格比 GPT-5.6 低约 50%;
  • Sol 和 Luna 将进入 Codex 和 ChatGPT Work;
  • DeepSWE 测试中,Sol 的成本明显低于 Fable 5;
  • Luna 更像是批量任务和简单工作流的低价选项;
  • 改进的 prompt caching 用于减少 Agent 的重复处理。

独立测试仍需要单独看。Artificial Analysis 的资料显示,Sol 的 Coding Agent Index 有提升,Luna 的分数反而有回落。低价不代表所有任务都更强。

代码 Agent、缓存模块和输出结果之间的抽象流程

开发者应该怎么分配任务

可以先按任务风险和重复程度分四类:

任务优先考虑原因
复杂架构设计、关键决策Opus 5.5 或 Astra错误成本高,值得用更强模型复核
多文件编码和长时间 AgentSol、Opus 5.5需要能力与运行成本平衡
批量分类、摘要、格式转换Luna任务重复度高,单次价值有限
有明确规则的自动化流程Luna 先跑,抽样用 Sol 复核降低整体成本,同时保留质量检查

不要一上来把全部任务迁移到最低价模型。先拿一批已有输入做 A/B 测试,记录成功率、人工返工时间和总 token,再决定是否切换。

一个便宜模型如果每十次要人工重做三次,最后成本可能高于使用更贵的模型一次完成。

为什么这次更像价格战

过去的模型发布通常围绕更大的上下文、更高的榜单分数或新的模态。现在三款模型的发布都在强调另一件事:Agent 会持续调用模型,开发者更关心一条完整任务链的总成本。

一次 Agent 任务可能包括:

  1. 读取仓库和历史上下文;
  2. 规划步骤;
  3. 多次调用工具;
  4. 运行测试并修复错误;
  5. 总结结果并生成文件。

单次对话价格并不高,但长链路会把输入、输出和工具调用放大。缓存和低价模型因此比单次 benchmark 分数更接近生产问题。

ChatGPT 用户和 API 用户不要混为一谈

GPT-6 Sol 和 Luna 的发布入口并不完全相同。API 用户可以按模型 ID 申请调用,Codex 和 ChatGPT Work 则按订阅和账号逐步开放。普通 ChatGPT 对话界面不一定同时显示这两款模型。

Opus 5.5 也存在平台差异:Claude、Anthropic API、Amazon Web Services、Google Cloud 和 Microsoft Azure 的开放时间、模型别名和计费规则可能不同。

看到“模型已发布”,不等于你的账号已经可以直接使用。进入生产前要核对:

  • 模型 ID;
  • API 区域和权限;
  • 输入输出价格;
  • 缓存价格;
  • 最大上下文和最大输出;
  • 是否允许工具调用和批量请求。

一套低风险迁移方法

如果你已经在使用 GPT-6 Astra、GPT-5.6 或 Opus 5,可以这样测试:

  1. 选取一批已经完成、结果可评分的真实任务。
  2. 把输入、工具权限和输出格式固定下来。
  3. 分别运行旧模型和新模型,不同时修改提示词。
  4. 记录 API 花费、耗时、失败次数和人工返工时间。
  5. 先把低风险重复任务切到 Luna 或 Sol。
  6. 复杂任务继续使用强模型,并让低价模型做草稿或预处理。

不要只看每百万 token 的价格。最终应该比较“完成一个合格任务的总成本”。

站内已有的 Grok 4.7 API 价格对比 适合和这篇放在一起看。生产环境仍要保留官方 API 和故障回退,不要把单一模型当成唯一入口。

结论:先算任务成本,再选模型

这轮发布的信号很清楚:模型能力仍在竞争,但 Agent 的普及让成本成为同等重要的指标。

Opus 5.5 更像是能力和成本的重新平衡,GPT-6 Sol 更适合把中高难度任务放进生产,Luna 则把大量简单调用的价格压到很低。最终选择不该由型号大小决定,而应该由任务失败代价、重复次数和人工复核成本决定。

来源

模型价格、开放范围和能力会变化。本文仅作技术信息整理,不构成模型采购或业务架构建议。