一句话结论:Grok 4.7 没有在公开对比里赢过 Claude Fable 5.1,但每百万输入 2 美元、输出 6 美元的起步价仍有竞争力。适合先拿低风险任务试跑,不适合因为一张榜单就全量迁移。

Grok 4.7 在 2026 年 9 月 21 日公布后,中文讨论很快变成了“Grok 反超”。这句话说得太满。公开数字里,它在 GDPval、AA-Briefcase 和 CursorBench 4.0 都落后于 Claude Fable 5.1;真正值得看的,是价格、速度和它在长任务里的表现。

Grok 4.7 的价格与模型对比概念图

先确认价格:2 美元只是起步档

目前公开信息能确认的是:

  • 标准档每百万输入 token 2 美元,每百万输出 token 6 美元。
  • fast 档主打更高速度,价格大约是标准档的两倍。
  • 4.7 的长上下文加价规则还没有完整出现在公开价格表里。
  • Grok 4.6 在约 20 万 token 以内也是 2 美元 / 6 美元,超过后输入和输出价格会上调。

因此,“2 美元”不能直接等同于所有请求的最终成本。短提示、普通代码修改和批量改写可以先按起步价估算;长上下文 Agent、反复工具调用和 fast 档要单独记录账单。

Grok 4.7 标准档与 fast 档的价格梯度概念图

公开对比:输在哪里

以下数字来自公开报道引用的官方自测,不能当成独立盲测:

测试Grok 4.7Claude Fable 5.1读法
GDPval16951735知识工作 Elo,Fable 领先
AA-Briefcase16571678多小时办公任务,Fable 领先
CursorBench 4.046.3%51.8%编程准确率,仍落后
Terminal-Bench 4.038.0%未完整披露终端任务不能只看单项

CursorBench 由 Cursor 制作,相关报道还提到 SpaceX 与 Cursor 的关系。这个背景不等于测试无效,但足以说明:不要只拿这一项证明模型已经全面领先。更稳妥的做法,是把 Terminal-Bench 和自己的代码仓库一起看。

哪些任务可以先换

适合先试 Grok 4.7 的任务,是失败后容易重跑的工作:

  • 搜索资料后的初步整理和改写;
  • 普通代码补全、测试生成和低风险重构;
  • 可以人工复核的批量分类;
  • 对延迟和调用成本敏感的 Agent 流程。

合同、迁移方案、安全代码和不能人工复核的长链工具调用,先不要全量切换。榜单只说明相对位置,不能替你承担一次错误输出的返工成本。

按失败成本分配 Grok 4.7 与旗舰模型的任务概念图

最实用的测试:用自己的 20 个任务

不要只看官方 Elo。准备 20 个真实任务,每个模型都记录四项:

  1. 一次通过还是需要返工;
  2. 返工花了多少分钟;
  3. 输入和输出 token 费用;
  4. 工具调用是否中途失控。

如果 Grok 4.7 的返工时间没有明显增加,价格优势才有意义。交互式编码可以试 fast 档;过夜批处理通常先用标准档,再看实际延迟是否值得加价。

想同时比较 Grok、Claude 和其他模型,可以先看站内的 9Router 多模型网关指南 。需要备用模型入口时,也可以查看 APIMart 模型入口 ,生产流量仍建议保留官方 API 和故障回退。

常见问题

Grok 4.7 是公开榜单第一吗?

不是。按目前公开的官方对比,GDPval、AA-Briefcase 和 CursorBench 4.0 都落后于 Claude Fable 5.1。

2 美元能覆盖所有请求吗?

不能。2 美元 / 6 美元是起步价格,fast 档更贵,长上下文规则也要以实际价格表和控制台账单为准。

要不要马上换掉 Claude?

不用。先把低风险、可重跑的任务分流给 Grok 4.7,用 20 个真实任务比较成功率、返工时间和 token 费用,再决定是否扩大比例。

价格、模型可用性和第三方工具路由可能随时变化。本文数据按 2026 年 9 月 22 日前后的公开信息整理,调用前请以官方控制台为准。