🎯 Artificial Analysis Intelligence Index v4.2的当日页面中,Claude Fable 5.1以57分领先,GPT-6 Astra以55分紧随其后。总榜适合筛选候选模型,真实选型还要看任务类型、单位成本和运行边界。

一张榜单很容易制造“第一名通吃”的错觉。v4.2恰好说明了相反的情况:Fable 5.1在综合指数领先,Astra在长文档推理、输出Token效率和部分自动化任务上表现突出。
更重要的变化来自评测方法。Artificial Analysis增加了复杂知识工作与PDF推理测试,把私有留出测试的权重提高到40%,用来降低针对公开题库刷榜的空间。
📌 v4.2到底改了什么
Artificial Analysis在2026年9月4日发布Intelligence Index v4.2 。这次中期更新包含四项关键调整:
| 变化 | 含义 |
|---|---|
| 加入AA-Briefcase | 测试多周、关联任务很多的专业知识工作 |
| 加入GDP.pdf | 测试跨4,592页PDF的长文档推理 |
| 移除GPQA Diamond | 该科学推理评测已接近饱和 |
| 私有测试权重升至40% | v4.1的约两倍,减少公开题库适配 |
AA-Briefcase使用私有留出任务,项目由行业专家设计,包含多个相互关联的任务和大量输入文件。它同时看任务成功、分析质量和交付呈现。
GDP.pdf由100份PDF、10个领域和1,275个专家标准构成。All-pass Rate要求一项任务的全部标准都通过,评分很严格。
📊 总榜给出的答案
截至2026年9月5日抓取的v4.2页面,领先配置如下:
| 模型配置 | Intelligence Index |
|---|---|
| Claude Fable 5.1 Max(带默认fallback) | 57 |
| GPT-6 Astra Max | 55 |
| GPT-6 Astra Xhigh | 54 |
Fable 5.1的领先配置启用了Anthropic默认服务端fallback。Artificial Analysis此前披露,相关安全触发请求可能路由到其他Claude模型,因此这个分数代表实际服务配置,而非纯粹单模型隔离测试。
榜单会随着评测版本、重跑结果和页面更新而变化。引用时应同时记录日期、版本、努力档位、fallback和Agent外壳。
🧪 分项结果为什么更有用
v4.2官方说明显示,不同模型在新增测试上形成了分工:
| 评测 | 领先方向 | 读法 |
|---|---|---|
| AA-Briefcase | Fable 5.1与Opus 5靠前 | 更接近复杂专业知识项目 |
| GDP.pdf | Astra 33.2% All-pass | 适合观察合同、财报、技术PDF等严格文档任务 |
| 输出Token效率 | Astra位于前沿 | 接近相同综合分时,用更少输出Token |
| 综合指数 | Fable 5.1领先 | 广泛推理、知识、数学和编码的组合结果 |
GDP.pdf中,Astra为33.2%,GPT-5.6 Sol为28.2%,Fable 5.1为26.2%。这项测试采用严格的全通过口径,适合看模型能否同时处理正文、表格、图表、脚注和排除条件。
OpenAI发布页还列出computer use、数学和网络安全等自家评测。这些数据属于供应商测试,Artificial Analysis属于独立测试。两类结果可以同时参考,标签必须分开。
🧭 你的工作流该看哪三列

模型选型至少需要三列:
- 真实任务成功率;
- 一次完成的总成本;
- 生产环境的运行边界。
| 工作负载 | 优先观察 |
|---|---|
| 长PDF、合同、财报 | GDP.pdf、引用准确率、表格提取、遗漏率 |
| 多周研究与交付物 | AA-Briefcase、返工率、格式遵循 |
| 长仓库编码Agent | Coding Agent测试、缓存、工具失败、测试通过率 |
| 浏览器自动化 | computer-use评测、网页变化容错、审批机制 |
| 网络安全防御 | 授权边界、拒绝策略、监控和审计能力 |
| 大规模批处理 | 单位任务成本、吞吐、限速和输出长度 |
榜单分差很小时,努力档位和Agent外壳可能比模型品牌更重要。Fable 5.1从low到max的输出Token跨度很大,Astra也提供low、medium、high、xhigh和max档位。
⚙️ 一套可复用的选型流程
先从业务中抽取20至50个真实任务,保留输入、工具、验收标准和人工结果。然后固定环境做对照:
model: gpt-6-astra
reasoning_effort: high
agent_shell: codex
success_criteria:
- required tests pass
- no unauthorized file changes
- output follows requested schema
metrics:
- first_pass_success
- retry_count
- total_input_tokens
- cached_input_tokens
- output_tokens
- tool_calls
- wall_clock_time
- human_review_minutes
每个模型至少跑两轮:第一轮看初始表现,第二轮修正提示和工具配置。所有模型使用相同验收标准,允许使用各自合理的官方推荐配置。
榜单用于把20个候选缩到3个,内部评测再把3个缩到1至2个。需要统一多模型调用和故障回退,可参考9Router多模型网关指南 。独立API入口可查看APIMart模型入口 。
❓ FAQ
现在总榜第一是谁?
在2026年9月5日抓取的Artificial Analysis v4.2页面中,Claude Fable 5.1 Max带默认fallback以57分领先,Astra Max为55分。榜单会更新,发稿时应重新核对。
为什么旧文章写Fable 66分?
66分来自较早的Index版本。v4.2加入新评测、移除饱和项目并调整权重,跨版本分数不能直接横向比较。
Astra在哪一项更突出?
v4.2的GDP.pdf中,Astra以33.2% All-pass领先。官方还强调其输出Token效率位于高分模型前沿。
私有测试能彻底防刷榜吗?
私有留出题降低了针对公开题库优化的空间。模型训练数据、评测泄露、提示与工具配置仍可能影响结果,所以方法和运行记录同样重要。
选模型只看总榜够吗?
总榜适合初筛。迁移决策需要同一批真实任务、同一套工具、单位成本和可复现验收。
