Claude Opus 5.5 (xhigh with fallback)
Anthropic具有回退功能的强劲表现。
- 回退逻辑
- 稳健推理
Huit catégories. Vingt-quatre modèles leaders. Mis à jour mensuellement. Avec des citations adaptées à l'IA.
One issue a month, all archived. Trace how the AI capability map shifts month over month.
最新的推理能力领导者,展示在逻辑处理和决策制定方面最先进的模型。
Previously: Claude Opus 5
在推理方面领先,得分强劲。
具有回退功能的强劲表现。
具有回退功能的高推理能力。
最大化推理与回退。
X高推理与回退。
最大化推理能力。
Claude Opus 5.5 以 58 的智能指数得分取代了 Claude Opus 5 成为领导者。
Anthropic 继续凭借其 Claude Opus 系列在推理类别中占据主导地位。
在当前 Text to Image Arena 中,GPT Image 2.5 Sunburst (max) 以 Elo 1197 领跑,其后是 GPT Image 2.5 Flare (max)(1191)和 GPT Image 2 (high)(1171)。Sunburst 的样本数为 13,433。
Previously: GPT Image 2 / Nano Banana 2
当前 Text to Image Arena 榜首,Elo 1197。
当前 Text to Image Arena 排名第 2,Elo 1191。
当前 Text to Image Arena 排名第 3,Elo 1171。
当前 Text to Image Arena 排名第 4,Elo 1150。
当前 Text to Image Arena 排名第 5,Elo 1147。
当前 Text to Image Arena 排名第 6,Elo 1122。
本期榜首已由 8 月刊的 GPT Image 2 / Nano Banana 2 组合更替。
开放权重图像模型方面,Ideogram 4.0 (Quality) 以 1011 领跑,其后是 Ideogram 4.0(1003)和 FLUX.2 [dev](1000)。
Gemini Omni Flash 以 1233 Elo 继续领跑支持音频的文生视频榜单,Wan 3.0 以 1229 紧随其后。在无音频赛道中,榜首则由 Wan 3.0 以 1336 获得。
继续领跑有音频视频赛道,领先 Wan 3.0 四个 Elo。
有音频赛道位列第二,同时登顶无音频榜单。
仅落后第二名 Wan 3.0 两个 Elo,并拥有前五名中最低的榜单价格。
当前支持音频的视频模型中排名最高的开放权重方案。
跻身竞争密集的前五,与榜首仅相差 23 Elo。
本月榜首较 8 月未变,但 Wan 3.0 升至第二;两个 MiniMax H3 版本分别占据第三和第四位。
头部竞争高度胶着:第一名 Gemini Omni Flash 与第五名 Dreamina Seedance 2.0 720p 仅相差 23 Elo。同期前五名的价格差异显著,每分钟从 $2.40 到 $12.00 不等。
Terminal-Bench 2.1 覆盖软件工程、系统管理、数据处理、模型训练与安全任务。此次更新包含 89 项任务,并修正了环境和指令问题;pass@1 按三次重复运行取平均值,评测由 Artificial Analysis 独立执行。
Previously: Claude Opus 5
取得 Terminal-Bench 2.1 当前最高的经验证成绩。
与榜首配置仅相差 0.4 个百分点。
帮助 Claude Fable 5.1 包揽榜单前三名。
Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 取代 8 月榜首 Claude Opus 5。由于 Terminal-Bench 2.1 属于刷新后的评测版本,9 月百分比不宜与上期分数直接比较。
榜单前三均为 Claude Fable 5.1 的不同推理强度配置,成绩集中在 89.9% 至 91.4%。对企业选型而言,推理强度档位已成为与基础模型名称同样重要的评估维度。
Cartesia Sonic 3.6 于 2026 年 8 月发布,目前以 1278 Elo 位居 Provider Voice Arena 榜首。Inworld Realtime TTS-2 以 1243 排名第二,SpeechifyAI Simba 3.2 和 Alibaba Qwen-Audio-3.0-TTS-Plus 分别以 1238、1235 紧随其后。
Previously: Realtime 2
这款于 2026 年 8 月发布的模型成为 Provider Voice Arena 新榜首。
在本期供应商语音榜单中排名第二。
位列第三,与 Realtime TTS-2 相差 5 个 Elo 分。
Alibaba 的语音模型跻身竞争紧密的第一梯队,位列第四。
Luna TTS 进入 Provider Voice Arena 前五。
凭借标准版与 Flash 版,Inworld 在前六名中占据两个席位。
Cartesia Sonic 3.6 取代 8 月榜首 Realtime 2;在本期榜单中,Inworld Realtime TTS-2 位列第二。
头部六款模型的 API 成本差异明显:SpeechifyAI Simba 3.2 的标价为每 100 万字符 $6.6,Sonic 3.6 为 $49.0,VUI Labs Luna TTS 则为 $80.0。开放权重阵营中,Breeze TTS 2 以 1203 成为排名最高的 TTS 模型。
Mureka V9 以 1177 Elo 位居 Instrumental Music Arena 榜首,Suno V5.5 以 1171 排名第二,Mureka V8 以 1143 排名第三。该榜单采用盲选偏好投票,并将器乐与人声模式分开评测。
Previously: Suno v5.5
以 2,237 个样本支撑评测,位居 Instrumental Music Arena 榜首。
基于 2,222 个样本取得 1171 Elo,排名第二。
以 1143 Elo 位列第三,样本量为 3,130 个。
基于 2,713 个样本取得 1137 Elo,排名第四。
以 1113 Elo 位列第五,样本量为 2,212 个。
基于 2,959 个样本取得 1102 Elo,排名第六。
Mureka V9 取代 8 月榜首 Suno v5.5;Suno V5.5 本期降至第二位。
Mureka 与 Suno 各占前四名中的两个席位。各模型样本量从 StepAudio 3 Music 的 2,212 个到 Mureka V8 的 3,130 个不等;来源页面未提供音乐模型价格。
Vision Arena 于 2026 年 9 月 13 日发布的榜单覆盖 152 个模型和 1,314,119 次投票。Claude Fable 5 High 以 1310±8 位居第一,Qwen3.8 Max 以 1302±8 紧随其后,两个 Claude Opus 4.7 配置也进入前四。
Previously: Claude Fable 5
位居 9 月 Vision Arena 榜首。
与榜首相差 8 个 Elo 分。
排名第 3,仅落后 Qwen3.8 Max 1 分。
标准配置比 High 配置低 1 分。
帮助 Anthropic 占据前五名中的四席。
Claude Fable 5 High 登上榜首,接替 8 月榜单中的 Claude Fable 5。
榜首模型每 100 万输入和输出 token 的价格分别为 $10 和 $50;第二名 Qwen3.8 Max 分别为 $2 和 $6。对于重视部署成本的企业,前两名之间存在明显价差。
MiMo-V2.6-Pro 以 46 分位列 Artificial Analysis 开放权重模型第一,GLM-5.3 max 以 45 分紧随其后,Kimi K3 max 以 44 分排名第三。
Previously: Kimi K3
当前 Intelligence Index 排名最高的开放权重模型。
位列开放权重模型第二,与榜首相差 1 个指数点。
8 月榜首本期位列开放权重模型第三。
GLM-5.3-Flash 位列当前开放权重榜第四。
Qwen3.8 2.4T A95B 的 Intelligence Index 得分为 40。
Qwen3.8-Flash-Next 同样取得 40 分,与 Qwen3.8 2.4T A95B 持平。
MiMo-V2.6-Pro 取代 8 月榜首 Kimi K3,成为本期开放权重模型的新领跑者。
开放权重模型继续保持竞争力,但与专有模型的绝对前沿仍有差距:MiMo-V2.6-Pro 得分为 46,而 Claude Opus 5.5 max with fallback 为 58。
GPT-6 Luna (low) 的单任务成本为 $0.0045,Intelligence Index 为 21。本期将其列为性价比领先者,是基于 Artificial Analysis 同一对比表作出的编辑判断:在已明确列出的正成本模型中,其单任务成本最低,同时智能得分高于两款成本显示为 $0.00 的实用型模型。
Previously: DeepSeek V4 Flash 0731
已明确列出的正成本模型中单任务成本最低,同时取得 21 的 Intelligence Index。
以每任务 $0.01 跻身当前 Cost per Task 领先模型。
单任务成本同为 $0.01,与 Granite 4.2 3B 持平。
GPT-6 Luna (low) 取代 8 月榜首 DeepSeek V4 Flash 0731。
Command A+ 与 North Mini Code 的单任务成本均显示为 $0.00,但 Intelligence Index 分别只有 13 和 10。企业评估总体价值时,不能脱离这一性能差距仅比较账面成本。
What changed across the AI model landscape this month — distilled from the data above.
前沿文本领导者已从 Claude Opus 5 转移到 Claude Opus 5.5,反映了推理能力的持续进步。
所引用材料未包含 deepseek-flash-0731 的已核实事实条目或 URL,因此本期不对其模型、分数、发布日期或排名作出判断。
H3 系列在有音频视频榜单前四名中连续占据两个席位:Minimax H3 Max post-trained by fal 以 1227 Elo 排名第三,价格为每分钟 $2.40;MiniMax H3 Open Weights 以 1220 排名第四,并位居有音频开放权重模型首位。
Nano Banana 2 (Gemini 3.1 Flash Image) 在当前 Text to Image Arena 中以 1122 Elo 排名第 6。榜首 GPT Image 2.5 Sunburst 达到 1197,两者相差 75 分。
当前没有一家厂商横扫所有生成式媒体赛道:GPT Image 2.5 Sunburst 以 1197 Elo 领跑文生图,Gemini Omni Flash 以 1233 位居有声文生视频第一,Cartesia Sonic 3.6 以 1278 登顶 TTS,Mureka V9 则以 1177 领先纯音乐生成。