VOL. 2026ISSUE 09Mis à jour le 2026-09-24

Classement mensuel des LLM

Huit catégories. Vingt-quatre modèles leaders. Mis à jour mensuellement. Avec des citations adaptées à l'IA.

9
categories
46
models
7
sources
Partager cette éditionXLinkedIn
01
推理能力最强的LLM

推理

最新的推理能力领导者,展示在逻辑处理和决策制定方面最先进的模型。

Previously: Claude Opus 5

Leader actuel
Claude Opus 5.5
Anthropic

在推理方面领先,得分强劲。

Score
58
  • 01逻辑处理
  • 02决策制定
Runners-up
2

Claude Opus 5.5 (xhigh with fallback)

Anthropic

具有回退功能的强劲表现。

  • 回退逻辑
  • 稳健推理
56
3

Claude Opus 5.5 (high with fallback)

Anthropic

具有回退功能的高推理能力。

  • 高容量
  • 回退支持
54
4

Claude Fable 5.1 (max with fallback)

Anthropic

最大化推理与回退。

  • 最大化逻辑
  • 回退
53
5

Claude Fable 5.1 (xhigh with fallback)

Anthropic

X高推理与回退。

  • X高逻辑
  • 回退
53
6

GPT-6 Astra (max)

OpenAI

最大化推理能力。

  • 最大化推理
  • 高级逻辑
53
Change

Claude Opus 5.5 以 58 的智能指数得分取代了 Claude Opus 5 成为领导者。

Market

Anthropic 继续凭借其 Claude Opus 系列在推理类别中占据主导地位。

02
GPT Image 2.5 Sunburst (max) 以 Elo 1197 登顶 Text to Image Arena

文生图

在当前 Text to Image Arena 中,GPT Image 2.5 Sunburst (max) 以 Elo 1197 领跑,其后是 GPT Image 2.5 Flare (max)(1191)和 GPT Image 2 (high)(1171)。Sunburst 的样本数为 13,433。

Previously: GPT Image 2 / Nano Banana 2

Leader actuel
GPT Image 2.5 Sunburst (max)
OpenAI

当前 Text to Image Arena 榜首,Elo 1197。

Score
1197
  • 01样本数 13,433
  • 02API 价格:每 1,000 张图 $210.7
Runners-up
2

GPT Image 2.5 Flare (max)

OpenAI

当前 Text to Image Arena 排名第 2,Elo 1191。

  • 稳居榜单前二
1191
3

GPT Image 2 (high)

OpenAI

当前 Text to Image Arena 排名第 3,Elo 1171。

  • 进入榜单前三
  • API 价格:每 1,000 张图 $211.0
1171
4

Grok Imagine Image 2.0

xAI

当前 Text to Image Arena 排名第 4,Elo 1150。

  • API 价格:每 1,000 张图 $60.0
1150
5

MAI-Image-2.6

Microsoft

当前 Text to Image Arena 排名第 5,Elo 1147。

  • API 价格:每 1,000 张图 $38.9
1147
6

Nano Banana 2 (Gemini 3.1 Flash Image)

Google

当前 Text to Image Arena 排名第 6,Elo 1122。

  • API 价格:每 1,000 张图 $67.0
1122
Change

本期榜首已由 8 月刊的 GPT Image 2 / Nano Banana 2 组合更替。

Market

开放权重图像模型方面,Ideogram 4.0 (Quality) 以 1011 领跑,其后是 Ideogram 4.0(1003)和 FLUX.2 [dev](1000)。

03
支持音频的文生视频模型

视频生成

Gemini Omni Flash 以 1233 Elo 继续领跑支持音频的文生视频榜单,Wan 3.0 以 1229 紧随其后。在无音频赛道中,榜首则由 Wan 3.0 以 1336 获得。

Leader actuel
Gemini Omni Flash
Google

继续领跑有音频视频赛道,领先 Wan 3.0 四个 Elo。

Score
1233 Elo
  • 01有音频榜单以 1233 Elo 排名第 1
  • 02无音频榜单以 1330 排名第 2
  • 03榜单价格为每分钟 $6.00
Runners-up
2

Wan 3.0

Alibaba

有音频赛道位列第二,同时登顶无音频榜单。

  • 有音频榜单以 1229 Elo 排名第 2
  • 无音频榜单以 1336 排名第 1
  • 榜单价格为每分钟 $12.00
1229 Elo
3

Minimax H3 Max post-trained by fal

fal

仅落后第二名 Wan 3.0 两个 Elo,并拥有前五名中最低的榜单价格。

  • 有音频榜单以 1227 Elo 排名第 3
  • 与第二名仅相差 2 Elo
  • 榜单价格为每分钟 $2.40
1227 Elo
4

MiniMax H3 Open Weights

MiniMax

当前支持音频的视频模型中排名最高的开放权重方案。

  • 以 1220 Elo 领跑有音频开放权重模型
  • 有音频总榜排名第 4
  • 榜单价格为每分钟 $7.80
1220 Elo
5

Dreamina Seedance 2.0 720p

ByteDance

跻身竞争密集的前五,与榜首仅相差 23 Elo。

  • 有音频榜单以 1210 Elo 排名第 5
  • 距第一名仅 23 Elo
  • 榜单价格为每分钟 $9.07
1210 Elo
Change

本月榜首较 8 月未变,但 Wan 3.0 升至第二;两个 MiniMax H3 版本分别占据第三和第四位。

Market

头部竞争高度胶着:第一名 Gemini Omni Flash 与第五名 Dreamina Seedance 2.0 720p 仅相差 23 Elo。同期前五名的价格差异显著,每分钟从 $2.40 到 $12.00 不等。

04
Claude Fable 5.1 包揽经验证榜单前三名

代码与终端任务

Terminal-Bench 2.1 覆盖软件工程、系统管理、数据处理、模型训练与安全任务。此次更新包含 89 项任务,并修正了环境和指令问题;pass@1 按三次重复运行取平均值,评测由 Artificial Analysis 独立执行。

Previously: Claude Opus 5

Leader actuel
Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback
Anthropic

取得 Terminal-Bench 2.1 当前最高的经验证成绩。

Score
91.4%
  • 01以 91.4% pass@1 位列第 1
  • 02采用 Max Effort 自适应推理配置
  • 03评测覆盖五类技术与运维任务
Runners-up
2

Claude Fable 5.1 Adaptive Reasoning Xhigh with Default Fallback

Anthropic

与榜首配置仅相差 0.4 个百分点。

  • 以 91.0% pass@1 位列第 2
  • 采用 Xhigh 自适应推理配置
  • 在 89 项任务的刷新版评测中保持 90% 以上成绩
91.0%
3

Claude Fable 5.1 Adaptive Reasoning High with Default Fallback

Anthropic

帮助 Claude Fable 5.1 包揽榜单前三名。

  • 以 89.9% pass@1 位列第 3
  • 采用 High 自适应推理配置
  • 较榜首 Max Effort 配置低 1.5 个百分点
89.9%
Change

Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 取代 8 月榜首 Claude Opus 5。由于 Terminal-Bench 2.1 属于刷新后的评测版本,9 月百分比不宜与上期分数直接比较。

Market

榜单前三均为 Claude Fable 5.1 的不同推理强度配置,成绩集中在 89.9% 至 91.4%。对企业选型而言,推理强度档位已成为与基础模型名称同样重要的评估维度。

05
Sonic 3.6 登顶 Provider Voice Arena

语音与文本转语音

Cartesia Sonic 3.6 于 2026 年 8 月发布,目前以 1278 Elo 位居 Provider Voice Arena 榜首。Inworld Realtime TTS-2 以 1243 排名第二,SpeechifyAI Simba 3.2 和 Alibaba Qwen-Audio-3.0-TTS-Plus 分别以 1238、1235 紧随其后。

Previously: Realtime 2

Leader actuel
Cartesia Sonic 3.6
Cartesia

这款于 2026 年 8 月发布的模型成为 Provider Voice Arena 新榜首。

Score
1278 Elo
  • 01以 1278 Elo 排名第一
  • 02API 标价为每 100 万字符 $49.0
Runners-up
2

Inworld Realtime TTS-2

Inworld

在本期供应商语音榜单中排名第二。

  • 取得 1243 Elo
  • API 标价为每 100 万字符 $20.8
1243 Elo
3

SpeechifyAI Simba 3.2

SpeechifyAI

位列第三,与 Realtime TTS-2 相差 5 个 Elo 分。

  • 取得 1238 Elo
  • API 标价为每 100 万字符 $6.6
1238 Elo
4

Alibaba Qwen-Audio-3.0-TTS-Plus

Alibaba

Alibaba 的语音模型跻身竞争紧密的第一梯队,位列第四。

  • 取得 1235 Elo
  • API 标价为每 100 万字符 $27.6
1235 Elo
5

VUI Labs Luna TTS

VUI Labs

Luna TTS 进入 Provider Voice Arena 前五。

  • 取得 1230 Elo
  • API 标价为每 100 万字符 $80.0
1230 Elo
6

Inworld Realtime TTS-2 Flash

Inworld

凭借标准版与 Flash 版,Inworld 在前六名中占据两个席位。

  • 取得 1214 Elo
  • API 标价为每 100 万字符 $10.4
1214 Elo
Change

Cartesia Sonic 3.6 取代 8 月榜首 Realtime 2;在本期榜单中,Inworld Realtime TTS-2 位列第二。

Market

头部六款模型的 API 成本差异明显:SpeechifyAI Simba 3.2 的标价为每 100 万字符 $6.6,Sonic 3.6 为 $49.0,VUI Labs Luna TTS 则为 $80.0。开放权重阵营中,Breeze TTS 2 以 1203 成为排名最高的 TTS 模型。

06
基于盲选偏好投票的 AI 器乐生成排名

器乐音乐生成

Mureka V9 以 1177 Elo 位居 Instrumental Music Arena 榜首,Suno V5.5 以 1171 排名第二,Mureka V8 以 1143 排名第三。该榜单采用盲选偏好投票,并将器乐与人声模式分开评测。

Previously: Suno v5.5

Leader actuel
Mureka V9
Mureka

以 2,237 个样本支撑评测,位居 Instrumental Music Arena 榜首。

Score
1177 Elo
  • 01在器乐模型盲选偏好排名中取得最高 Elo
  • 02排名领先于 Suno V5.5
Runners-up
2

Suno V5.5

Suno

基于 2,222 个样本取得 1171 Elo,排名第二。

  • 盲选偏好得分位列第二
  • Suno 有两款模型进入前四,Suno V5.5 排名更高
1171 Elo
3

Mureka V8

Mureka

以 1143 Elo 位列第三,样本量为 3,130 个。

  • Mureka 第二款进入前三的模型
  • 在列出的六款领先模型中样本量最高
1143 Elo
4

Suno V5

Suno

基于 2,713 个样本取得 1137 Elo,排名第四。

  • 进入该榜单前四
  • Suno 第二款跻身前四的模型
1137 Elo
5

StepAudio 3 Music

StepAudio

以 1113 Elo 位列第五,样本量为 2,212 个。

  • 在器乐盲选偏好投票中进入前五
  • 排名领先于 Google Lyria 3 Pro
1113 Elo
6

Google Lyria 3 Pro

Google

基于 2,959 个样本取得 1102 Elo,排名第六。

  • 进入器乐音乐榜单前六
  • 评测覆盖 2,959 个样本
1102 Elo
Change

Mureka V9 取代 8 月榜首 Suno v5.5;Suno V5.5 本期降至第二位。

Market

Mureka 与 Suno 各占前四名中的两个席位。各模型样本量从 StepAudio 3 Music 的 2,212 个到 Mureka V8 的 3,130 个不等;来源页面未提供音乐模型价格。

07
基于逾 131 万次投票的 Vision Arena 排名

视觉理解

Vision Arena 于 2026 年 9 月 13 日发布的榜单覆盖 152 个模型和 1,314,119 次投票。Claude Fable 5 High 以 1310±8 位居第一,Qwen3.8 Max 以 1302±8 紧随其后,两个 Claude Opus 4.7 配置也进入前四。

Previously: Claude Fable 5

Leader actuel
Claude Fable 5 High
Anthropic

位居 9 月 Vision Arena 榜首。

Score
1310±8
  • 01在 152 个模型中排名第 1
  • 02所在榜单累计获得 1,314,119 次投票
Runners-up
2

Qwen3.8 Max

Alibaba

与榜首相差 8 个 Elo 分。

  • 综合排名第 2
  • 每 100 万输入和输出 token 的价格分别为 $2 和 $6
1302±8
3

Claude Opus 4.7 High

Anthropic

排名第 3,仅落后 Qwen3.8 Max 1 分。

  • 综合排名第 3
  • 得分区间为 1301±7
1301±7
4

Claude Opus 4.7

Anthropic

标准配置比 High 配置低 1 分。

  • 综合排名第 4
  • 与榜首仅相差 10 分
1300±7
5

Claude Opus 4.6 High

Anthropic

帮助 Anthropic 占据前五名中的四席。

  • 综合排名第 5
  • 仅落后 Claude Opus 4.7 1 分
1299±7
Change

Claude Fable 5 High 登上榜首,接替 8 月榜单中的 Claude Fable 5。

Market

榜首模型每 100 万输入和输出 token 的价格分别为 $10 和 $50;第二名 Qwen3.8 Max 分别为 $2 和 $6。对于重视部署成本的企业,前两名之间存在明显价差。

08
MiMo-V2.6-Pro 登顶开放权重榜

开放权重模型

MiMo-V2.6-Pro 以 46 分位列 Artificial Analysis 开放权重模型第一,GLM-5.3 max 以 45 分紧随其后,Kimi K3 max 以 44 分排名第三。

Previously: Kimi K3

Leader actuel
MiMo-V2.6-Pro
Xiaomi

当前 Intelligence Index 排名最高的开放权重模型。

Score
46
  • 01Intelligence Index 得分 46
  • 02开放权重模型排名第一
  • 03上下文窗口为 1M
Runners-up
2

GLM-5.3 max

Zhipu AI

位列开放权重模型第二,与榜首相差 1 个指数点。

  • Intelligence Index 得分 45
  • 开放权重模型排名第二
  • GLM-5.3 的上下文窗口为 1M
45
3

Kimi K3 max

Moonshot AI

8 月榜首本期位列开放权重模型第三。

  • Intelligence Index 得分 44
  • 开放权重模型排名第三
  • 上下文窗口为 1M
44
4

GLM-5.3-Flash

Zhipu AI

GLM-5.3-Flash 位列当前开放权重榜第四。

  • Intelligence Index 得分 42
  • 开放权重模型排名第四
42
5

Qwen3.8 2.4T A95B

Alibaba

Qwen3.8 2.4T A95B 的 Intelligence Index 得分为 40。

  • Intelligence Index 得分 40
  • 进入开放权重模型前六
40
6

Qwen3.8-Flash-Next

Alibaba

Qwen3.8-Flash-Next 同样取得 40 分,与 Qwen3.8 2.4T A95B 持平。

  • Intelligence Index 得分 40
  • 进入开放权重模型前六
40
Change

MiMo-V2.6-Pro 取代 8 月榜首 Kimi K3,成为本期开放权重模型的新领跑者。

Market

开放权重模型继续保持竞争力,但与专有模型的绝对前沿仍有差距:MiMo-V2.6-Pro 得分为 46,而 Claude Opus 5.5 max with fallback 为 58。

09
以更低单任务成本维持更高智能基线

成本效益

GPT-6 Luna (low) 的单任务成本为 $0.0045,Intelligence Index 为 21。本期将其列为性价比领先者,是基于 Artificial Analysis 同一对比表作出的编辑判断:在已明确列出的正成本模型中,其单任务成本最低,同时智能得分高于两款成本显示为 $0.00 的实用型模型。

Previously: DeepSeek V4 Flash 0731

Leader actuel
GPT-6 Luna (low)
OpenAI

已明确列出的正成本模型中单任务成本最低,同时取得 21 的 Intelligence Index。

Score
$0.0045/task
  • 01每任务成本 $0.0045
  • 02Intelligence Index 为 21
  • 03综合成本与智能表现后,被编辑评估为总体性价比最佳
Runners-up
2

Granite 4.2 3B

IBM

以每任务 $0.01 跻身当前 Cost per Task 领先模型。

  • 每任务成本 $0.01
  • 3B 模型规格
  • 在已公布的低成本领先模型序列中位列第 2
$0.01/task
3

Ministral 3 3B

Mistral AI

单任务成本同为 $0.01,与 Granite 4.2 3B 持平。

  • 每任务成本 $0.01
  • 3B 模型规格
  • 进入当前三款低成本领先模型名单
$0.01/task
Change

GPT-6 Luna (low) 取代 8 月榜首 DeepSeek V4 Flash 0731。

Market

Command A+ 与 North Mini Code 的单任务成本均显示为 $0.00,但 Intelligence Index 分别只有 13 和 10。企业评估总体价值时,不能脱离这一性能差距仅比较账面成本。

Editorial · 05 observations

Ce qui a changé ce mois-ci

What changed across the AI model landscape this month — distilled from the data above.

01

前沿重置

前沿文本领导者已从 Claude Opus 5 转移到 Claude Opus 5.5,反映了推理能力的持续进步。

02

deepseek-flash-0731:暂无已核实的 9 月更新

所引用材料未包含 deepseek-flash-0731 的已核实事实条目或 URL,因此本期不对其模型、分数、发布日期或排名作出判断。

03

MiniMax H3 同时覆盖开放权重与后训练视频层级

H3 系列在有音频视频榜单前四名中连续占据两个席位:Minimax H3 Max post-trained by fal 以 1227 Elo 排名第三,价格为每分钟 $2.40;MiniMax H3 Open Weights 以 1220 排名第四,并位居有音频开放权重模型首位。

04

图像榜单洗牌,Nano Banana 2 位列第六

Nano Banana 2 (Gemini 3.1 Flash Image) 在当前 Text to Image Arena 中以 1122 Elo 排名第 6。榜首 GPT Image 2.5 Sunburst 达到 1197,两者相差 75 分。

05

生成式媒体的领先优势正按模态分化

当前没有一家厂商横扫所有生成式媒体赛道:GPT Image 2.5 Sunburst 以 1197 Elo 领跑文生图,Gemini Omni Flash 以 1233 位居有声文生视频第一,Cartesia Sonic 3.6 以 1278 登顶 TTS,Mureka V9 则以 1177 领先纯音乐生成。

Sources
  1. [01]
  2. [02]
  3. [03]
  4. [04]
  5. [05]
  6. [06]
  7. [07]
    Vision Arenacommunity leaderboard
预约 demo