🎯 Artificial Analysis Intelligence Index v4.2的当日页面中,Claude Fable 5.1以57分领先,GPT-6 Astra以55分紧随其后。总榜适合筛选候选模型,真实选型还要看任务类型、单位成本和运行边界。

Fable 5.1与Astra在Artificial Analysis总榜的当日分数

一张榜单很容易制造“第一名通吃”的错觉。v4.2恰好说明了相反的情况:Fable 5.1在综合指数领先,Astra在长文档推理、输出Token效率和部分自动化任务上表现突出。

更重要的变化来自评测方法。Artificial Analysis增加了复杂知识工作与PDF推理测试,把私有留出测试的权重提高到40%,用来降低针对公开题库刷榜的空间。


📌 v4.2到底改了什么

Artificial Analysis在2026年9月4日发布Intelligence Index v4.2 。这次中期更新包含四项关键调整:

变化含义
加入AA-Briefcase测试多周、关联任务很多的专业知识工作
加入GDP.pdf测试跨4,592页PDF的长文档推理
移除GPQA Diamond该科学推理评测已接近饱和
私有测试权重升至40%v4.1的约两倍,减少公开题库适配

AA-Briefcase使用私有留出任务,项目由行业专家设计,包含多个相互关联的任务和大量输入文件。它同时看任务成功、分析质量和交付呈现。

GDP.pdf由100份PDF、10个领域和1,275个专家标准构成。All-pass Rate要求一项任务的全部标准都通过,评分很严格。


📊 总榜给出的答案

截至2026年9月5日抓取的v4.2页面,领先配置如下:

模型配置Intelligence Index
Claude Fable 5.1 Max(带默认fallback)57
GPT-6 Astra Max55
GPT-6 Astra Xhigh54

Fable 5.1的领先配置启用了Anthropic默认服务端fallback。Artificial Analysis此前披露,相关安全触发请求可能路由到其他Claude模型,因此这个分数代表实际服务配置,而非纯粹单模型隔离测试。

榜单会随着评测版本、重跑结果和页面更新而变化。引用时应同时记录日期、版本、努力档位、fallback和Agent外壳。


🧪 分项结果为什么更有用

v4.2官方说明显示,不同模型在新增测试上形成了分工:

评测领先方向读法
AA-BriefcaseFable 5.1与Opus 5靠前更接近复杂专业知识项目
GDP.pdfAstra 33.2% All-pass适合观察合同、财报、技术PDF等严格文档任务
输出Token效率Astra位于前沿接近相同综合分时,用更少输出Token
综合指数Fable 5.1领先广泛推理、知识、数学和编码的组合结果

GDP.pdf中,Astra为33.2%,GPT-5.6 Sol为28.2%,Fable 5.1为26.2%。这项测试采用严格的全通过口径,适合看模型能否同时处理正文、表格、图表、脚注和排除条件。

OpenAI发布页还列出computer use、数学和网络安全等自家评测。这些数据属于供应商测试,Artificial Analysis属于独立测试。两类结果可以同时参考,标签必须分开。


🧭 你的工作流该看哪三列

模型选型应同时检查任务成功、单位成本和运行边界

模型选型至少需要三列:

  1. 真实任务成功率;
  2. 一次完成的总成本;
  3. 生产环境的运行边界。
工作负载优先观察
长PDF、合同、财报GDP.pdf、引用准确率、表格提取、遗漏率
多周研究与交付物AA-Briefcase、返工率、格式遵循
长仓库编码AgentCoding Agent测试、缓存、工具失败、测试通过率
浏览器自动化computer-use评测、网页变化容错、审批机制
网络安全防御授权边界、拒绝策略、监控和审计能力
大规模批处理单位任务成本、吞吐、限速和输出长度

榜单分差很小时,努力档位和Agent外壳可能比模型品牌更重要。Fable 5.1从low到max的输出Token跨度很大,Astra也提供low、medium、high、xhigh和max档位。


⚙️ 一套可复用的选型流程

先从业务中抽取20至50个真实任务,保留输入、工具、验收标准和人工结果。然后固定环境做对照:

model: gpt-6-astra
reasoning_effort: high
agent_shell: codex
success_criteria:
  - required tests pass
  - no unauthorized file changes
  - output follows requested schema
metrics:
  - first_pass_success
  - retry_count
  - total_input_tokens
  - cached_input_tokens
  - output_tokens
  - tool_calls
  - wall_clock_time
  - human_review_minutes

每个模型至少跑两轮:第一轮看初始表现,第二轮修正提示和工具配置。所有模型使用相同验收标准,允许使用各自合理的官方推荐配置。

榜单用于把20个候选缩到3个,内部评测再把3个缩到1至2个。需要统一多模型调用和故障回退,可参考9Router多模型网关指南 。独立API入口可查看APIMart模型入口


❓ FAQ

现在总榜第一是谁?

在2026年9月5日抓取的Artificial Analysis v4.2页面中,Claude Fable 5.1 Max带默认fallback以57分领先,Astra Max为55分。榜单会更新,发稿时应重新核对。

为什么旧文章写Fable 66分?

66分来自较早的Index版本。v4.2加入新评测、移除饱和项目并调整权重,跨版本分数不能直接横向比较。

Astra在哪一项更突出?

v4.2的GDP.pdf中,Astra以33.2% All-pass领先。官方还强调其输出Token效率位于高分模型前沿。

私有测试能彻底防刷榜吗?

私有留出题降低了针对公开题库优化的空间。模型训练数据、评测泄露、提示与工具配置仍可能影响结果,所以方法和运行记录同样重要。

选模型只看总榜够吗?

总榜适合初筛。迁移决策需要同一批真实任务、同一套工具、单位成本和可复现验收。