VOL. 2026ISSUE 07Mis à jour le 2026-07-27

Classement mensuel des LLM

Huit catégories. Vingt-quatre modèles leaders. Mis à jour mensuellement. Avec des citations adaptées à l'IA.

9
categories
31
models
10
sources
Partager cette éditionXLinkedIn
01
Text Generation & Reasoning

文本生成与综合推理

7 月 24 日 Anthropic 发布 Claude Opus 5,以 61 分(最大模式)夺回 Artificial Analysis Intelligence Index 榜首——领先自家 Mythos-class 的 Fable 5(60)一分。OpenAI GPT-5.6 Sol 落在 59,Moonshot 的开源 Kimi K3 以 57 分杀进前沿梯队。

Previously: Claude Fable 5

Leader actuel
Claude Opus 5
Anthropic

7 月 24 日发布。以 61 分夺回 AA Intelligence Index 榜首——价格只有 Mythos-class 梯队的一半。

Score
61
  • 01Intelligence Index:61(max)/ 60(xhigh)
  • 02SWE-bench Verified 约 96%
  • 03$5 / $25 每百万 tokens
  • 041M 上下文
  • 05发布日期 2026-07-24
Runners-up
2

Claude Fable 5

Anthropic

6 月 9 日 Mythos-class 首发;Opus 5 发布后居总榜第 2(60 分)。6 月曾短暂出口管制,6 月 23 日恢复。

  • Intelligence Index:60
  • Humanity's Last Exam:53%
  • Mythos-class 安全防护
  • 1M+ 上下文 · 自适应推理
  • 发布日期 2026-06-09
60
3

GPT-5.6 Sol

OpenAI

6 月 26 日预览,7 月 9 日全面开放。Sol/Terra/Luna 分层家族;Sol max 得分 59,Terminal-Bench 2.1 达 88.8%。

  • Intelligence Index:59(max)
  • Terminal-Bench 2.1:88.8%
  • $5 / $30 每百万 tokens
  • 1M 上下文
  • 2026-07-09 全面开放
59
4

Kimi K3

Moonshot AI

7 月 17 日发布。2.8T 参数开源权重 MoE——首个进入前沿梯队的开源模型,同时登顶 LMArena WebDev。

  • Intelligence Index:57(开源第 1)
  • 2.8T MoE · 1M 上下文
  • LMArena WebDev 第 1
  • 开放权重
  • 发布日期 2026-07-17
57
5

Grok 4.5

xAI

7 月 8 日发布,$2/$6 每百万 tokens——前沿梯队里最便宜的推理模型。

  • 激进定价:$2 / $6 每百万
  • 常驻推理 · 1M 上下文
  • agentic 与工具调用强
  • 发布日期 2026-07-08
53
Change

2026 年 7 月 24 日发布。AA Intelligence Index:61(max)/ 60(xhigh),$5/$25 每百万 tokens——约为 Mythos-class 梯队一半价格。

Market

Opus 5 成为前沿默认主力;Fable 5 守住 Mythos-class 天花板;GPT-5.6 Sol 是 OpenAI 的分层回应;Kimi K3 是首个进入前沿梯队的开源模型。

02
Image Generation

图像生成

GPT Image 2 现在连 Artificial Analysis 文生图 Arena 质量榜也登顶了(ELO 1338)——质量与生态双冠。Reve 2.1 发布当天空降第 2(ELO 1301),字节 Seedream 5.0 Pro 进前 10,Black Forest 的 FLUX 3 限量发布,成为首个图/视频/音频 omni 模型。

Previously: GPT Image-2

Leader actuel
GPT Image 2
OpenAI

登顶 AA 文生图 Arena(ELO 1338),叠加既有生态与定价优势。

Score
1338
  • 01AA 文生图 Arena ELO:1338(第 1)
  • 02按 token 计费
  • 03Batch API 50% 折扣
  • 04高保真输入
  • 05发布日期 2026-04-21
Runners-up
2

Reve 2.1

Reve

7 月 9 日发布。凭借分层生成与 $24/千图的颠覆性定价,发布当天空降 AA 榜第 2。

  • AA 文生图 Arena ELO:1301(第 2)
  • 分层生成
  • $24 / 千图
  • 首发即一线质量
1301
3

Seedream 5.0 Pro

ByteDance

7 月 8 日发布。图层分离 + 顶级文字渲染,跻身 AA 榜前 10。

  • AA 文生图 Arena ELO:1239(前 10)
  • 图层分离
  • 文字渲染强
  • $90 / 千图
1239
Change

Recraft V4.1 跌出第一梯队;Reve 2.1(7 月 9 日)与 Seedream 5.0 Pro(7 月 8 日)新进榜;FLUX 3(7 月 23 日)限量发布。

Market

质量 + 生态选 GPT Image 2;分层生成、$24/千图选 Reve 2.1;文字渲染选 Seedream 5.0 Pro;企业版权安全仍选 Firefly。

03
Video Generation

视频生成

Google Gemini Omni Flash 以 ELO 1240 拿下 Artificial Analysis 文生视频 Arena(含音频),终结 Seedance 2.0 的连冠(1225)。字节的回击已经在路上:Seedance 2.5(7 月 16 日起灰度)带来原生 30 秒 4K/10bit 生成,尚未入榜。OpenAI 正式退场——Sora API 将于 9 月 24 日关停。

Previously: Seedance 2.0

Leader actuel
Gemini Omni Flash
Google

以 ELO 1240 登顶 AA 文生视频 Arena(含音频)——Google 首个拿下音画同步冠军的模型。

Score
1240
  • 01AA 含音频视频榜 #1 · ELO 1240
  • 02原生音画同步
  • 03Gemini Omni 全家桶集成
  • 04API 现成可用
Runners-up
2

Seedance 2.0 / 2.5

ByteDance

2.0 以 ELO 1225 退居第 2;2.5(原生 30 秒、4K/10bit、50 个参考输入)自 7 月 16 日灰度,尚未入榜。

  • AA 含音频视频榜 ELO:1225(第 2)
  • 2.5:原生 30 秒 4K/10bit
  • 多模态输入(文/图/音/视频)
  • 双分支扩散 Transformer
1225
3

Kling 3.0 Pro

Kuaishou 快手

6 月 17 日 Turbo 升级,守住亚太短视频性价比位;3.0 线原生 4K/60fps。

  • AA 含音频视频榜 ELO:1110
  • 3.0 Turbo:最快迭代
  • 原生 4K/60fps(3.0 线)
  • 原生抖音 / TikTok 风格
1110
Change

Arena 榜首易主:Seedance 2.0 → Gemini Omni Flash(1240 vs 1225);Seedance 2.5 自 7 月 16 日灰度上线;Sora API 9 月 24 日停服。

Market

音画同步竞技场最强选 Gemini Omni Flash;30 秒 4K 生产选 Seedance 2.5;亚太短视频性价比选 Kling 3.0。

04
Code Generation & Agentic Coding

代码生成与 Agentic Coding

Claude Opus 5(7 月 24 日)把 SWE-bench Verified 推到约 96%——历史新高;同时 Moonshot 的开源 Kimi K3 以 1679 分杀上 LMArena WebDev 榜首,成为第一个登顶前端代码竞技场的中国模型。代码前沿一分为二:基准榜归 Anthropic,人气榜归 Kimi。

Previously: Claude Fable 5

Leader actuel
Claude Opus 5
Anthropic

发布当天 SWE-bench Verified 约 96%(独立评测最高 97.0%)——代码新前沿。

Score
96
  • 01SWE-bench Verified:约 96%(第 1)
  • 02$5 / $25 每百万 tokens
  • 03长程 agentic 编辑
  • 041M 上下文
  • 05发布日期 2026-07-24
Runners-up
2

Kimi K3

Moonshot AI

以 1679 分登顶 LMArena WebDev——首个居该榜第 1 的中国模型。开放权重,独立评测 SWE-bench Verified 93.4%。

  • LMArena WebDev:1679(第 1)
  • 开放权重 · 2.8T MoE
  • SWE-bench Verified:93.4%
  • $3 / $15 每百万 tokens
  • 发布日期 2026-07-17
1679
3

Claude Fable 5

Anthropic

SWE-bench Verified 95%;最难多文件、长程任务的 Mythos-class 天花板。

  • SWE-bench Verified:95%
  • Mythos-class agentic coding
  • 1M+ 上下文
  • 6 月出口暂停后已恢复
95
4

GPT-5.6 Sol

OpenAI

Terminal-Bench 2.1 达 88.8%——沙盒终端 Agent 最强;SWE-bench Pro 64.6%。

  • Terminal-Bench 2.1:88.8%(第 1)
  • SWE-bench Pro:64.6%
  • 内置沙盒 Shell
  • 2026-07-09 全面开放
88.8
Change

Opus 5 登顶 SWE-bench Verified(约 96%,7 月 24 日);Kimi K3 登顶 LMArena WebDev(1679,7 月 16 日),领先 Fable 5(1631)与 GPT-5.6 Sol(1618)。

Market

最难重构与长程 Agent 选 Opus 5;Mythos-class 天花板选 Fable 5;前端开发与开源部署选 Kimi K3;沙盒终端 Agent 选 GPT-5.6 Sol。

05
Voice / Speech

语音 / 音频

speech-to-speech 王位没有变化——OpenAI Realtime 2 仍领跑 agentic 语音。但组件级冠军都换成了中国厂商:阿里 Qwen-Audio-3.0-TTS-Plus 登顶 AA TTS 榜(ELO 1234),Fun-Realtime-ASR-preview 以 1.7% WER 领跑 STT。ElevenLabs 以 Music v2 和 Scribe v2 realtime 回应。

Previously: ElevenLabs v3

Leader actuel
Realtime 2
OpenAI

仍是 agentic 语音默认选择。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。

  • 01可配置推理
  • 02speech-to-speech agent
  • 03流式翻译变体
  • 04流式 STT 变体
  • 05发布日期 2026-05-07
Runners-up
2

Qwen-Audio-3.0-TTS-Plus

Alibaba

以 ELO 1234 登顶 AA TTS 榜——中国厂商首个 TTS 冠军。

  • AA TTS ELO:1234(第 1)
  • 2026 年 7 月发布
  • 多语言 + 中日韩强势
  • 阿里云原生
1234
3

ElevenLabs v3

ElevenLabs

AA TTS 滑到第 11,但仍是角色声音克隆默认;新增 Scribe v2 realtime 与 Music v2 API。

  • 角色声音克隆 SOTA
  • Scribe v2 realtime STT(2.2% WER)
  • Music v2 API(6 月 15 日)
  • 100+ 语言
Change

TTS 冠军:Fun-Realtime-TTS → Qwen-Audio-3.0-TTS-Plus(1234);STT 冠军:MAI-Transcribe-1.5 → Fun-Realtime-ASR-preview(1.7% WER)。

Market

agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;转录选 Fun-Realtime-ASR;角色声音克隆选 ElevenLabs v3。

06
Music Generation

音乐生成

更正上月判断:Suno v6 最终没有发布——v5.5 仍是线上默认与类目第一。真正的动作在别处:ElevenLabs Music v2 于 6 月 15 日上线 API,Google Lyria 继续借 Gemini Omni 走跨模态 any-to-music 路线。

Leader actuel
Suno v5.5
Suno

仍是 Suno 最新版本——v6 并未发布。整曲连贯与歌词韵律最佳。

  • 01整曲连贯 SOTA
  • 02歌词韵律最佳
  • 03多语言演唱
  • 04风格迁移
Runners-up
2

Udio v3

Udio

录音棚级混音,分轨输出。

  • 分轨输出
  • 录音棚级混音
  • 电子曲风强势
  • DAW 友好
3

ElevenLabs Music v2

ElevenLabs

6 月 15 日上线 API。基于授权曲库的音乐生成,支持微调。

  • API 优先的音乐生成
  • 授权曲库
  • Music Finetunes API
  • 与 ElevenLabs 语音栈集成
Change

Suno v6 错过传闻中的 6 月窗口,至今未官宣;v5.5 稳居第 1。ElevenLabs Music v2 经 API 入场。

Market

整曲生成选 Suno v5.5;录音棚级分轨选 Udio v3;授权曲库工作流选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。

07
Vision / Multimodal Understanding

视觉 / 多模态理解

Fable 5 以 1327 ELO 拿下 LMArena Vision 榜首,终结 Opus 4.7 一代的霸榜。Opus 5 与 GPT-5.6 Sol 在身后约 15 分以内紧咬——视觉榜头部第一次变成真正的三厂竞赛。

Previously: Claude Opus 4.7-thinking

Leader actuel
Claude Fable 5
Anthropic

以 1327 分登顶 LMArena Vision(7 月 12 日按新票仓重算)——同时领跑文本竞技场。

Score
1327
  • 01LMArena Vision ELO:1327(第 1)
  • 02文本竞技场同居第 1
  • 03OCR + 文档理解 SOTA
  • 041M+ 上下文
Runners-up
2

Claude Opus 5

Anthropic

新多模态旗舰,Vision 榜上距 Fable 5 仅约 15 ELO。

  • 前沿多模态理解
  • 文档问答 + 图表
  • $5 / $25 每百万 tokens
  • 发布日期 2026-07-24
3

Gemini 3.1 Pro

Google

视频理解与长时序推理最佳。

  • 视频理解 SOTA
  • 长时序推理
  • 集成 Robotics-ER 1.6
  • 200 万 token+ 多模态
Change

Vision 第 1 易主:Opus 4.7-thinking(1309)→ Fable 5(1327,7 月 12 日按新票仓重算)。

Market

OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.6 Sol;视频理解选 Gemini 3.1 Pro。

08
Open-Source / Open-Weights

开源 / 开放权重

Moonshot 的 Kimi K3(7 月 17 日)成为新的开源之王:2.8T 参数 MoE,AA Intelligence Index 57——全球第 3,首个进入前沿梯队的开源模型,距 Opus 5 仅 4 分,还 outright 登顶 LMArena WebDev。代价是输出定价涨到 $15/百万,接近 K2.6 的 4 倍。

Previously: Kimi K2.6

Leader actuel
Kimi K3
Moonshot AI

AA Intelligence Index 57 居开源榜首——全球第 3,距闭源前沿仅 4 分。同时登顶 LMArena WebDev。

Score
57
  • 01AA Intelligence Index:57(开源第 1)
  • 022.8T MoE · 1M 上下文
  • 03LMArena WebDev 第 1
  • 04$3 / $15 每百万 tokens
  • 05发布日期 2026-07-17
Runners-up
2

Kimi K2.6

Moonshot AI

前任开源之王,现在是 K 系的性价比之选:Index 54,输出价仅为 K3 的 1/4。

  • AA Intelligence Index:54
  • 开源权重
  • 输出约 $4 / 百万(K3 为 $15)
  • 中英双强
54
3

DeepSeek V4 Pro

DeepSeek

MIT 开源权重,AA Intelligence Index 52——便宜的前沿级推理默认。满血 V4 仍只是传闻。

  • AA Intelligence Index:52
  • MIT 许可 · 开放权重
  • $0.435 / $0.87 每百万
  • 1M tokens 上下文
52
4

Gemma 4 12B

Google

Apache 2.0 开放权重。encoder-free 原生多模态,256K 上下文,16GB 笔记本即可本地跑。

  • Apache 2.0 · 开放权重
  • 256K 上下文 · 原生多模态
  • 16GB 显存可跑
  • MMLU-Pro 77.2 · GPQA-Diamond 78.8
Change

Kimi K3(57)从 K2.6(54)手中接过开源王座;K2.7 Code(1T/32B MoE)6 月中补强编程线;DeepSeek V4 满血版仍只是传闻。

Market

前沿级开源部署选 Kimi K3;同生态、输出价仅 1/4 选 K2.6;便宜推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B。

09
每美元智能

性价比 / 价格性能比

性价比之战进入僵持:DeepSeek 自 4 月起没动过价格,V4 Flash 仍以混合约 $0.06 / 百万 tokens 提供 Intelligence Index 47——同级旗舰的十分之一。两件事值得注意:旧的 deepseek-chat/reasoner 别名 7 月 24 日退役(需迁移到 deepseek-v4-flash/pro);MiniMax M3 上市促销结束,回到 $0.60/$2.40 标准价。

Leader actuel
DeepSeek V4 Flash
DeepSeek

每美元智能之王,自 4 月未调价。Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一。

Score
47
  • 01AA Intelligence Index:47
  • 02$0.14 输入 / $0.28 输出 每百万
  • 03混合 ≈ $0.06 / 百万
  • 04MIT 开源权重 · 1M 上下文
Runners-up
2

DeepSeek V4 Pro

DeepSeek

高智能 + 低价象限的最佳平衡。Intelligence Index 52,$0.435/$0.87——仅为同档旗舰的零头。

  • AA Intelligence Index:52
  • $0.435 输入 / $0.87 输出 每百万
  • 前沿级推理
  • MIT 开源权重
52
3

MiniMax M3

MiniMax

SWE-bench Verified 80%+ 里最便宜的模型。上市促销结束,现为 $0.60/$2.40 标准价。

  • SWE-bench Verified:80%+
  • $0.60 输入 / $2.40 输出 每百万
  • 最便宜的 agentic 可用梯队
  • 开放权重
Change

头部厂商无调价;DeepSeek 旧别名 7 月 24 日退役;MiniMax M3 促销结束;GLM-5.2 开放按量 API。

Market

超大批量低成本选 V4 Flash;要更强推理又想省钱选 V4 Pro;要最便宜的 SWE-bench 80%+ 选 MiniMax M3;想分散厂商选 Qwen3.7 Plus。

Editorial · 07 observations

Ce qui a changé ce mois-ci

What changed across the AI model landscape this month — distilled from the data above.

01

Opus 5 以半价夺回王座

Mythos-class Fable 5 发布仅六周后,Anthropic 又推出 Opus 5(7 月 24 日):Intelligence Index 61,$5/$25——用 Opus 档的价格给到接近 Mythos 的智能。前沿迭代节奏已按周计算,Anthropic 包揽总榜前三(Opus 5 max、Opus 5 xhigh、Fable 5)。

02

Kimi K3:开源进入前沿梯队

Moonshot 2.8T 参数的 Kimi K3(7 月 17 日)拿到 Intelligence Index 57——全球第 3,距 Opus 5 仅 4 分——并登顶 LMArena WebDev,成为首个领跑该榜的中国模型。开源权重不再低人一档,而是进入前沿带。

03

GPT-5.6:OpenAI 的分层回应

Sol/Terra/Luna 家族(6 月 26 日预览,7 月 9 日 GA)把前沿拆成价格-性能分层。Sol max 拿到 Intelligence Index 59 并领跑 Terminal-Bench 2.1(88.8%)——有竞争力,但这是 OpenAI 第一次处于追赶位置,而不是定调位置。

04

视频王座归 Google,字节迅速回击

Gemini Omni Flash 终结 Seedance 2.0 在 AA 视频榜的连冠(1240 对 1225)。字节 Seedance 2.5(原生 30 秒 4K)已在灰度放量,而 OpenAI 彻底退出战场——Sora API 将于 9 月 24 日停服。

05

没等到的那款音乐模型

市场普遍预期 6 月发布的 Suno v6 最终没有落地——v5.5 仍是第一。与此同时 ElevenLabs Music v2 借 API 悄然入场,主打授权曲库。音乐是本月唯一前沿停滞的类目。

06

中国厂商包揽语音组件冠军

阿里 Qwen-Audio-3.0-TTS-Plus 拿下 AA TTS 冠军(ELO 1234),Fun-Realtime-ASR-preview 领跑 STT(1.7% WER)。OpenAI 仍占据 speech-to-speech agent 层,但语音的「卖水生意」已转移到中国厂商手中。

07

性价比之战进入僵持

DeepSeek 自 4 月未调价——V4 Flash 混合约 $0.06 仍领跑每美元智能。本月看点是结构性的:旧别名 7 月 24 日退役,MiniMax M3 促销结束,GLM-5.2 开放按量。传闻 OpenAI 正考虑大幅降价,但尚未落地。

Sources
  1. [01]
  2. [02]
    LMArena Leaderboardcommunity leaderboard
  3. [03]
  4. [04]
    OpenAI Changelogofficial changelog
  5. [05]
    Anthropic Newsofficial changelog
  6. [06]
    Google DeepMind Blogofficial changelog
  7. [07]
    DeepSeek API Pricingofficial changelog
  8. [08]
    Moonshot AI / Kimiofficial changelog
  9. [09]
  10. [10]
预约 demo