<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>模型选型 on Huoke.Me - 跨境生活，从理财开始！</title><link>https://blog.huoke.me/tags/%E6%A8%A1%E5%9E%8B%E9%80%89%E5%9E%8B/</link><description>Recent content in 模型选型 on Huoke.Me - 跨境生活，从理财开始！</description><generator>Hugo</generator><language>cn</language><lastBuildDate>Sat, 05 Sep 2026 17:43:00 +0800</lastBuildDate><atom:link href="https://blog.huoke.me/tags/%E6%A8%A1%E5%9E%8B%E9%80%89%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Fable总榜第一,Astra怎么选</title><link>https://blog.huoke.me/posts/aa-index/</link><pubDate>Sat, 05 Sep 2026 17:43:00 +0800</pubDate><guid>https://blog.huoke.me/posts/aa-index/</guid><description>&lt;blockquote>
&lt;p>🎯 Artificial Analysis Intelligence Index v4.2的当日页面中，Claude Fable 5.1以57分领先，GPT-6 Astra以55分紧随其后。总榜适合筛选候选模型，真实选型还要看任务类型、单位成本和运行边界。&lt;/p>&lt;/blockquote>
&lt;p>&lt;img src="https://blog.huoke.me/img/posts/aa-index/hero.webp" alt="Fable 5.1与Astra在Artificial Analysis总榜的当日分数" title="Artificial Analysis v4.2模型分数" width="1200" height="630" loading="lazy" decoding="async">
&lt;/p>
&lt;p>一张榜单很容易制造“第一名通吃”的错觉。v4.2恰好说明了相反的情况：Fable 5.1在综合指数领先，Astra在长文档推理、输出Token效率和部分自动化任务上表现突出。&lt;/p>
&lt;p>更重要的变化来自评测方法。Artificial Analysis增加了复杂知识工作与PDF推理测试，把私有留出测试的权重提高到40%，用来降低针对公开题库刷榜的空间。&lt;/p>
&lt;hr>
&lt;h2 id="-v42到底改了什么">📌 v4.2到底改了什么&lt;/h2>
&lt;p>Artificial Analysis在2026年9月4日发布&lt;a href="https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2" target="_blank" rel="noopener noreferrer">Intelligence Index v4.2&lt;/a>
。这次中期更新包含四项关键调整：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>变化&lt;/th>
 &lt;th>含义&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>加入AA-Briefcase&lt;/td>
 &lt;td>测试多周、关联任务很多的专业知识工作&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>加入GDP.pdf&lt;/td>
 &lt;td>测试跨4,592页PDF的长文档推理&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>移除GPQA Diamond&lt;/td>
 &lt;td>该科学推理评测已接近饱和&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>私有测试权重升至40%&lt;/td>
 &lt;td>v4.1的约两倍，减少公开题库适配&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>AA-Briefcase使用私有留出任务，项目由行业专家设计，包含多个相互关联的任务和大量输入文件。它同时看任务成功、分析质量和交付呈现。&lt;/p>
&lt;p>GDP.pdf由100份PDF、10个领域和1,275个专家标准构成。All-pass Rate要求一项任务的全部标准都通过，评分很严格。&lt;/p>
&lt;hr>
&lt;h2 id="-总榜给出的答案">📊 总榜给出的答案&lt;/h2>
&lt;p>截至2026年9月5日抓取的v4.2页面，领先配置如下：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>模型配置&lt;/th>
 &lt;th style="text-align: right">Intelligence Index&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>Claude Fable 5.1 Max（带默认fallback）&lt;/td>
 &lt;td style="text-align: right">57&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>GPT-6 Astra Max&lt;/td>
 &lt;td style="text-align: right">55&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>GPT-6 Astra Xhigh&lt;/td>
 &lt;td style="text-align: right">54&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>Fable 5.1的领先配置启用了Anthropic默认服务端fallback。Artificial Analysis此前披露，相关安全触发请求可能路由到其他Claude模型，因此这个分数代表实际服务配置，而非纯粹单模型隔离测试。&lt;/p>
&lt;p>榜单会随着评测版本、重跑结果和页面更新而变化。引用时应同时记录日期、版本、努力档位、fallback和Agent外壳。&lt;/p>
&lt;hr>
&lt;h2 id="-分项结果为什么更有用">🧪 分项结果为什么更有用&lt;/h2>
&lt;p>v4.2官方说明显示，不同模型在新增测试上形成了分工：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>评测&lt;/th>
 &lt;th>领先方向&lt;/th>
 &lt;th>读法&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>AA-Briefcase&lt;/td>
 &lt;td>Fable 5.1与Opus 5靠前&lt;/td>
 &lt;td>更接近复杂专业知识项目&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>GDP.pdf&lt;/td>
 &lt;td>Astra 33.2% All-pass&lt;/td>
 &lt;td>适合观察合同、财报、技术PDF等严格文档任务&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>输出Token效率&lt;/td>
 &lt;td>Astra位于前沿&lt;/td>
 &lt;td>接近相同综合分时，用更少输出Token&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>综合指数&lt;/td>
 &lt;td>Fable 5.1领先&lt;/td>
 &lt;td>广泛推理、知识、数学和编码的组合结果&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>GDP.pdf中，Astra为33.2%，GPT-5.6 Sol为28.2%，Fable 5.1为26.2%。这项测试采用严格的全通过口径，适合看模型能否同时处理正文、表格、图表、脚注和排除条件。&lt;/p></description></item></channel></rss>