一句话结论:Grok 4.7 没有在公开对比里赢过 Claude Fable 5.1,但每百万输入 2 美元、输出 6 美元的起步价仍有竞争力。适合先拿低风险任务试跑,不适合因为一张榜单就全量迁移。
Grok 4.7 在 2026 年 9 月 21 日公布后,中文讨论很快变成了“Grok 反超”。这句话说得太满。公开数字里,它在 GDPval、AA-Briefcase 和 CursorBench 4.0 都落后于 Claude Fable 5.1;真正值得看的,是价格、速度和它在长任务里的表现。

先确认价格:2 美元只是起步档
目前公开信息能确认的是:
- 标准档每百万输入 token 2 美元,每百万输出 token 6 美元。
- fast 档主打更高速度,价格大约是标准档的两倍。
- 4.7 的长上下文加价规则还没有完整出现在公开价格表里。
- Grok 4.6 在约 20 万 token 以内也是 2 美元 / 6 美元,超过后输入和输出价格会上调。
因此,“2 美元”不能直接等同于所有请求的最终成本。短提示、普通代码修改和批量改写可以先按起步价估算;长上下文 Agent、反复工具调用和 fast 档要单独记录账单。

公开对比:输在哪里
以下数字来自公开报道引用的官方自测,不能当成独立盲测:
| 测试 | Grok 4.7 | Claude Fable 5.1 | 读法 |
|---|---|---|---|
| GDPval | 1695 | 1735 | 知识工作 Elo,Fable 领先 |
| AA-Briefcase | 1657 | 1678 | 多小时办公任务,Fable 领先 |
| CursorBench 4.0 | 46.3% | 51.8% | 编程准确率,仍落后 |
| Terminal-Bench 4.0 | 38.0% | 未完整披露 | 终端任务不能只看单项 |
CursorBench 由 Cursor 制作,相关报道还提到 SpaceX 与 Cursor 的关系。这个背景不等于测试无效,但足以说明:不要只拿这一项证明模型已经全面领先。更稳妥的做法,是把 Terminal-Bench 和自己的代码仓库一起看。
哪些任务可以先换
适合先试 Grok 4.7 的任务,是失败后容易重跑的工作:
- 搜索资料后的初步整理和改写;
- 普通代码补全、测试生成和低风险重构;
- 可以人工复核的批量分类;
- 对延迟和调用成本敏感的 Agent 流程。
合同、迁移方案、安全代码和不能人工复核的长链工具调用,先不要全量切换。榜单只说明相对位置,不能替你承担一次错误输出的返工成本。

最实用的测试:用自己的 20 个任务
不要只看官方 Elo。准备 20 个真实任务,每个模型都记录四项:
- 一次通过还是需要返工;
- 返工花了多少分钟;
- 输入和输出 token 费用;
- 工具调用是否中途失控。
如果 Grok 4.7 的返工时间没有明显增加,价格优势才有意义。交互式编码可以试 fast 档;过夜批处理通常先用标准档,再看实际延迟是否值得加价。
想同时比较 Grok、Claude 和其他模型,可以先看站内的 9Router 多模型网关指南 。需要备用模型入口时,也可以查看 APIMart 模型入口 ,生产流量仍建议保留官方 API 和故障回退。
常见问题
Grok 4.7 是公开榜单第一吗?
不是。按目前公开的官方对比,GDPval、AA-Briefcase 和 CursorBench 4.0 都落后于 Claude Fable 5.1。
2 美元能覆盖所有请求吗?
不能。2 美元 / 6 美元是起步价格,fast 档更贵,长上下文规则也要以实际价格表和控制台账单为准。
要不要马上换掉 Claude?
不用。先把低风险、可重跑的任务分流给 Grok 4.7,用 20 个真实任务比较成功率、返工时间和 token 费用,再决定是否扩大比例。
价格、模型可用性和第三方工具路由可能随时变化。本文数据按 2026 年 9 月 22 日前后的公开信息整理,调用前请以官方控制台为准。