IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。
本周榜单迎来大量新模型更新,国产模型亮点突出:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。
综合榜
本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型,表现极为突出。
国产模型在本次综合榜已有多款进入前 25 名,梯队分布如下:
阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;
月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;
阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。
| 排名 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-fable-5 | Anthropic | 1509 ±6 | 17799 | $10 / $50 | 1M |
| 2 | 🇺🇸 claude-opus-4-6-thinking | Anthropic | 1505 ±4 | 67203 | $5 / $25 | 1M |
| 3 | 🇺🇸 claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 54781 | $5 / $25 | 1M |
| 4 | 🇺🇸 claude-opus-4-6 | Anthropic | 1497 ±4 | 70970 | $5 / $25 | 1M |
| 5 | 🇨🇳 qwen3.8-max | 阿里 | 1496 ±10 | 3327 | $2 / $6 | 1M |
| 6 | 🇺🇸 claude-opus-4-7 | Anthropic | 1492 ±4 | 55992 | $5 / $25 | 1M |
| 7 | 🇺🇸 claude-opus-5-high | Anthropic | 1492 ±6 | 10704 | $5 / $25 | 1M |
| 8 | 🇺🇸 claude-opus-5-max | Anthropic | 1490 ±9 | 5124 | $5 / $25 | 1M |
| 9 | 🇺🇸 muse-spark-1.1 | Meta | 1490 ±6 | 12086 | $1.25 / $4.25 | N/A |
| 10 | 🇺🇸 muse-spark | Meta | 1488 ±6 | 13486 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | ||||||
| 13 | 🇨🇳 kimi-k3-max 预发布 | 月之暗面 | 1485 ±10 | 3556 | $3 / $15 | 1.05M |
| 22 | 🇨🇳 qwen3.7-max-preview 预发布 | 阿里 | 1475 ±10 | 3695 | $1.48 / $4.43 | 1M |
代码榜
代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。
国产模型在代码榜的具体排名如下:
月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;
阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;
阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;
智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;
小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。
| 排名 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-fable-5 | Anthropic | 1553 ±9 | 4823 | $10 / $50 | 1M |
| 2 | 🇺🇸 claude-opus-4-7-thinking | Anthropic | 1552 ±6 | 15649 | $5 / $25 | 1M |
| 3 | 🇺🇸 claude-opus-4-6-thinking | Anthropic | 1551 ±6 | 17433 | $5 / $25 | 1M |
| 4 | 🇺🇸 claude-opus-4-6 | Anthropic | 1548 ±6 | 19814 | $5 / $25 | 1M |
| 5 | 🇺🇸 claude-opus-4-7 | Anthropic | 1547 ±6 | 15915 | $5 / $25 | 1M |
| 6 | 🇺🇸 claude-opus-4-8-thinking | Anthropic | 1534 ±7 | 9830 | $5 / $25 | 1M |
| 7 | 🇺🇸 claude-opus-5-high | Anthropic | 1532 ±12 | 2918 | $5 / $25 | 1M |
| 8 | 🇨🇳 kimi-k3-max 预发布 | 月之暗面 | 1531 ±20 | 947 | $3 / $15 | 1.05M |
| 9 | 🇺🇸 claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7606 | $5 / $25 | 200K |
| 10 | 🇨🇳 qwen3.8-max 预发布 | 阿里 | 1530 ±19 | 991 | $2 / $6 | 1M |
| — 以下为 Top 10 外的国产模型 — | ||||||
| 17 | 🇨🇳 qwen3.7-max-preview 预发布 | 阿里 | 1525 ±18 | 1113 | $1.48 / $4.43 | 1M |
| 28 | 🇨🇳 glm-5.1 | 智谱 | 1518 ±7 | 9822 | $1.4 / $4.4 | 202.8K |
| 29 | 🇨🇳 mimo-v2.5-pro | 小米 | 1518 ±7 | 12665 | $0.44 / $0.87 | 1.05M |
前端开发榜
前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型非常接近。
国产模型整体处于中上游,具体排名如下:
月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,预发布状态;
阿里 qwen3.8-max 排名第 4,ELO 1668 分,预发布状态;
智谱 glm-5.2-max 排名第 7,ELO 1586 分;
字节跳动 seed-2.1-pro-preview 排名第 19,ELO 1527 分,预发布状态;
阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。
| 排名 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-opus-5-max | Anthropic | 1705 ±15 | 2192 | $5 / $25 | 1M |
| 2 | 🇨🇳 kimi-k3-max 预发布 | 月之暗面 | 1676 ±12 | 4366 | $3 / $15 | 1.05M |
| 3 | 🇺🇸 claude-opus-5-high | Anthropic | 1669 ±11 | 3873 | $5 / $25 | 1M |
| 4 | 🇨🇳 qwen3.8-max 预发布 | 阿里 | 1668 ±18 | 1563 | $2 / $6 | 1M |
| 5 | 🇺🇸 claude-fable-5 | Anthropic | 1630 ±9 | 6310 | $10 / $50 | 1M |
| 6 | 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1620 ±9 | 6000 | $5 / $30 | 1.05M |
| 7 | 🇨🇳 glm-5.2-max 预发布 | 智谱 | 1586 ±9 | 6361 | $1.4 / $4.4 | 1M |
| 8 | 🇨🇳 deepseek-v4-flash-high 预发布 | 深度求索 | 1577 ±18 | 1319 | $0.14 / $0.28 | 1.05M |
| 9 | 🇺🇸 claude-opus-4-8-thinking | Anthropic | 1566 ±8 | 8934 | $5 / $25 | 1M |
| 10 | 🇺🇸 claude-opus-4-7 | Anthropic | 1561 ±7 | 11755 | $5 / $25 | 1M |
| — 以下为 Top 10 外的国产模型 — | ||||||
| 19 | 🇨🇳 seed-2.1-pro-preview 预发布 | 字节跳动 | 1527 ±9 | 5513 | N/A | N/A |
| 23 | 🇨🇳 qwen3.7-max-20260517 | 阿里 | 1517 ±8 | 7840 | $1.48 / $4.43 | 1M |
| 24 | 🇨🇳 hy3 预发布 | 腾讯 | 1517 ±17 | 1491 | $0.13 / $0.53 | 262.1K |
| 25 | 🇨🇳 glm-5.1 预发布 | 智谱 | 1516 ±8 | 7377 | $1.4 / $4.4 | 202.8K |
| 26 | 🇨🇳 kimi-k2.6 预发布 | 月之暗面 | 1510 ±8 | 9256 | $0.95 / $4 | 262.1K |
| 30 | 🇨🇳 minimax-m3 预发布 | MiniMax | 1491 ±8 | 8155 | $0.6 / $2.4 | N/A |
智能体榜
智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ,仅为 0.33% ,可控性最强的模型是 Nemotron 3 Ultra,达到 20.73% 。
国产模型在智能体榜的排名和净提升度如下:
MiniMax minimax-m3 排名第 33 名,净提升度 2.55% ,任务确认成功率 5.67%;
深度求索 DeepSeek V4 Flash 排名第 34 名,净提升度 2.96% ,任务确认成功率 4.9%;
小米 Mimo V2.5 Pro 排名第 32 名,净提升度 2.52% ,任务确认成功率 3.81%;
阿里 Qwen3.7 Max 排名第 25 名,净提升度 0.53% ,任务确认成功率 1.95%;
月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 9.91% ,任务确认成功率 14.23%,进入智能体榜 Top 5。
| 排名 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 | 会话数 |
|---|---|---|---|---|---|---|---|
| 1 | 🇺🇸 Claude Fable 5 (High) | Anthropic | 12.58 ±2.19 | 10.26 | 24.42 | 12.93 | 23807 |
| 2 | 🇺🇸 Claude Opus 5 (Max) | Anthropic | 11.88 ±2.81 | 17.56 | 25.63 | 1.81 | 7253 |
| 3 | 🇺🇸 Claude Opus 5 (High) | Anthropic | 11.73 ±1.66 | 16.6 | 24.4 | 5.49 | 11114 |
| 4 | 🇺🇸 GPT 5.6 Sol (xHigh) | OpenAI | 10.02 ±1.63 | 8.61 | 21.9 | 8.96 | 16966 |
| 5 | 🇨🇳 Kimi K3 (Max) | 月之暗面 | 9.91 ±1.19 | 14.23 | 17.45 | 9.67 | 19586 |
| 6 | 🇺🇸 Claude Opus 4.8 (Thinking) | Anthropic | 9.43 ±1.64 | 8.75 | 21.05 | 9.77 | 34477 |
| 7 | 🇺🇸 Claude Sonnet 5 (High) | Anthropic | 8.57 ±2.0 | 7.95 | 16.12 | 6.74 | 24657 |
| 8 | 🇺🇸 GPT 5.5 (xHigh) | OpenAI | 8.49 ±0.95 | 5.82 | 12.91 | 8.24 | 43122 |
| 9 | 🇺🇸 Claude Opus 4.7 (Thinking) | Anthropic | 8.19 ±1.26 | 6.19 | 11.2 | 9.65 | 35471 |
| 10 | 🇺🇸 GPT 5.5 (High) | OpenAI | 7.89 ±0.88 | 5.63 | 11.31 | 9.18 | 68340 |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 19 | 🇺🇸 Claude Opus 4.8 | Anthropic | 3.34 ±1.94 | 8.24 | 12.75 | 8.39 | 32551 |
| 20 | 🇺🇸 Claude Sonnet 4.6 | Anthropic | 3.18 ±1.2 | 0.07 | 0.88 | 2.39 | 35966 |
| 23 | 🇨🇳 Kimi K2.7 Code | 月之暗面 | 0.44 ±1.82 | 4.73 | 3.42 | 3.71 | 10359 |
| 25 | 🇨🇳 Qwen3.7 Max | 阿里 | 0.53 ±0.97 | 1.95 | 5.89 | 0.2 | 20914 |
| 26 | 🇨🇳 DeepSeek V4 Pro | 深度求索 | 0.78 ±0.94 | 3.61 | 5.37 | 0.39 | 21459 |
| 27 | 🇨🇳 hy3 | 腾讯 | 1.03 ±1.88 | 1.55 | 2.83 | 8.17 | 8506 |
| 29 | 🇨🇳 Kimi K2.6 | 月之暗面 | 1.09 ±1.95 | 3.1 | 1.58 | 4.9 | 10436 |
| 30 | 🇨🇳 gemini-3.6-flash | 谷歌 | 1.59 ±2.68 | 0.15 | 6.2 | 2.59 | 2532 |
| 31 | 🇨🇳 Qwen3.7 Plus | 阿里 | 1.65 ±1.29 | 1.72 | 7.98 | 4.63 | 14112 |
| 32 | 🇨🇳 Mimo V2.5 Pro | 小米 | 2.52 ±1.01 | 3.81 | 8.05 | 2.11 | 21399 |
| 33 | 🇨🇳 Minimax M3 | MiniMax | 2.55 ±0.93 | 5.67 | 9.01 | 4.56 | 20996 |
| 34 | 🇨🇳 DeepSeek V4 Flash | 深度求索 | 2.96 ±0.95 | 4.9 | 8.38 | 3.98 | 20775 |
| 41 | 🇨🇳 Minimax M2.7 | MiniMax | 11.59 ±1.17 | 14.67 | 15.74 | 14.94 | 21221 |
AI 生图榜
AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功杀入 Top 6,成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。
| 排名 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 gpt-image-2 (medium) | OpenAI | 1381 ±5 | 66665 | N/A | N/A |
| 2 | 🇺🇸 reve-2.1 | Reve | 1300 ±8 | 6131 | N/A | N/A |
| 3 | 🇺🇸 muse-image | Meta | 1281 ±7 | 13261 | N/A | N/A |
| 4 | 🇺🇸 reve-2.0 | Reve | 1270 ±6 | 14563 | N/A | N/A |
| 5 | 🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search] | 谷歌 | 1263 ±6 | 25351 | N/A | N/A |
| 6 | 🇨🇳 seedream-5.0-pro 预发布 | 字节跳动 | 1257 ±6 | 20977 | N/A | N/A |
| 7 | 🇺🇸 mai-image-2.5 | Microsoft AI | 1254 ±5 | 41589 | N/A | N/A |
| 8 | 🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite) | 谷歌 | 1251 ±6 | 16201 | N/A | N/A |
| 9 | 🇺🇸 gemini-3-pro-image-2k (nano-banana-pro) | 谷歌 | 1246 ±3 | 135981 | N/A | N/A |
| 10 | 🇺🇸 gpt-image-1.5-high-fidelity | OpenAI | 1239 ±3 | 139642 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | ||||||
| 14 | 🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布 | 阿里 | 1191 ±6 | 11952 | N/A | N/A |
| 25 | 🇨🇳 hunyuan-image-3.0 预发布 | 腾讯 | 1151 ±3 | 172741 | N/A | N/A |
| 28 | 🇨🇳 seedream-4.5 预发布 | 字节跳动 | 1147 ±3 | 229805 | N/A | N/A |
| 30 | 🇨🇳 seedream-4-2k 预发布 | 字节跳动 | 1140 ±7 | 12599 | N/A | N/A |
AI 视频榜
AI 视频榜头部格局稳定,gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,两款国产模型稳居前五,表现稳定。国产模型共有 7 款进入前 30,整体占据中上游位置。
| 排名 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 gemini-omni-flash | 谷歌 | 1513 ±12 | 14571 | N/A | N/A |
| 2 | 🇨🇳 dreamina-seedance-2.0-720p 预发布 | 字节跳动 | 1479 ±11 | 47067 | N/A | N/A |
| 3 | 🇺🇸 muse-video | Meta | 1458 ±15 | 2160 | N/A | N/A |
| 4 | 🇨🇳 happyhorse-1.0 预发布 | 阿里 | 1428 ±13 | 21979 | N/A | N/A |
| 5 | 🇺🇸 sora-2-pro | OpenAI | 1365 ±8 | 44543 | $0 / $0.3 | N/A |
| 6 | 🇺🇸 veo-3.1-audio | 谷歌 | 1364 ±14 | 13687 | $0 / $0.4 | N/A |
| 7 | 🇺🇸 veo-3.1-audio-1080p | 谷歌 | 1363 ±10 | 24846 | N/A | N/A |
| 8 | 🇺🇸 veo-3.1-fast-audio | 谷歌 | 1362 ±11 | 39301 | $0 / $0.15 | N/A |
| 9 | 🇺🇸 veo-3.1-fast-audio-1080p | 谷歌 | 1358 ±10 | 25637 | N/A | N/A |
| 10 | 🇺🇸 grok-imagine-video-720p | SpaceXAI | 1349 ±8 | 151774 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | ||||||
| 12 | 🇨🇳 wan2.7-t2v 预发布 | 阿里 | 1347 ±9 | 15246 | N/A | N/A |
| 15 | 🇨🇳 wan2.6-t2v 预发布 | 阿里 | 1330 ±9 | 41706 | N/A | N/A |
| 16 | 🇨🇳 seedance-v1.5-pro 预发布 | 字节跳动 | 1256 ±7 | 75653 | N/A | N/A |
| 18 | 🇨🇳 wan2.5-t2v-preview 预发布 | 阿里 | 1252 ±10 | 25895 | N/A | N/A |
| 27 | 🇨🇳 hailuo-2.3 预发布 | MiniMax | 1202 ±7 | 72127 | N/A | N/A |
| 28 | 🇨🇳 hailuo-02-pro 预发布 | MiniMax | 1198 ±13 | 9365 | N/A | N/A |
| 29 | 🇨🇳 seedance-v1-pro 预发布 | 字节跳动 | 1190 ±11 | 12117 | N/A | N/A |
| 30 | 🇨🇳 hailuo-02-standard 预发布 | MiniMax | 1180 ±12 | 9333 | N/A | N/A |
总结来看,本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜,国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6;AI 视频榜始终有两款国产模型稳居前五,月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。