本期(2026-09-01)榜单共收录 333 个模型;竞技场方面,Claude Opus 5(Anthropic)以 1504 的 Elo 分继续领跑;中文能力上,Gemini 3.1 Pro 的 SuperCLUE 智能指数为 75.7;综合能力分(SuperCLUE 六维均值)第一为 Qwen3.8-Max(73.06 分);最便宜的模型是 Llama 4 Maverick,输入价格 ¥1.94 / 百万 tokens。

一、榜单总览

先看竞技场 Elo Top 10(点击模型名可进入详情页查看六维能力与历史趋势):

排名模型厂商EloSuperCLUE综合能力
1Claude Opus 5Anthropic150475.0
2Claude Opus 4.6Anthropic1503
3Claude Fable 5Anthropic1495
4Gemini 3.7 FlashGoogle1490
5Claude Opus 4.7Anthropic1490
6Muse Spark 1.2Meta1487
7Gemini 3.5 FlashGoogle148371.5
8Qwen3.8-Max阿里巴巴148271.573.1
9Gemini 3.1 ProGoogle148075.7
10Gemini 3 ProGoogle1479

二、本周变化:榜单进入稳定期

与上一期(2026-09-01)快照相比,本期榜单的 Elo 排名、SuperCLUE 得分与 API 价格均未发生变化。这通常意味着两件事:其一,LMArena 官方未发布新的 Elo 快照(竞技场数据为不定期更新);其二,各厂商处于发版间歇期,没有新模型入榜或调价。

稳定期恰恰是做「横评」的好窗口——排名不再频繁跳动,同一套数据下的模型对比结论更耐得住推敲。推荐使用模型对比工具,把关注的两三个模型拉到同一张雷达图下看六维差异。

三、综合能力看点:六维数据说明了什么

综合能力分取 SuperCLUE 六个维度的平均分,本期前三名:

Qwen3.8-Max(阿里巴巴)—— 73.06 分

数学推理
77.19
幻觉控制
86.08
科学推理
71.93
精确指令遵循
43.81
智能体编程
68.42
智能体任务规划
90.94

DeepSeek V4 Pro(深度求索)—— 71.72 分

数学推理
77.19
幻觉控制
89.73
科学推理
71.93
精确指令遵循
42.86
智能体编程
63.16
智能体任务规划
85.48

Kimi K3(月之暗面)—— 71.18 分

数学推理
71.93
幻觉控制
83.85
科学推理
70.17
精确指令遵循
40.95
智能体编程
75.79
智能体任务规划
84.35

几点观察:

  • 头部差距很小:前三名分差在 2 分以内,选型时不必迷信「第一名」,维度强弱比总分更值得关注;
  • 维度差异才是选型依据:重数学/科学推理的场景看推理维度,做 Agent 应用重点看智能体编程与任务规划两项;
  • 注意口径:海外模型若未参加当期 SuperCLUE 测评,榜单展示为参考估算值,横向对比时请留意标注。

四、价格动向:谁的性价比更高

当前输入价格最低的五个模型(输入 / 输出,每百万 tokens,按 1 美元 ≈ 7.2 元换算):

模型厂商输入 / 输出价开源
Llama 4 MaverickMeta¥1.94 / ¥6.12开源
混元 Hy3腾讯¥7.2 / ¥28.8开源
DeepSeek V4 Flash深度求索¥7.2 / ¥14.4开源
Qwen3.7-Max阿里巴巴¥9.0 / ¥27.0闭源
Gemini 3.5 FlashGoogle¥10.8 / ¥64.8闭源

本周各厂商定价无变化。整体来看,头部模型的价格战已阶段性趋缓,「降价换量」的窗口期在收窄,按当前价格做年度成本测算风险不大。

五、历史趋势:头部模型 Elo 走势

Claude Opus 5:2026-08-19(1508) → 2026-08-20(1505) → 2026-08-24(1504) → 本期(1504)(累计 -4

Claude Opus 4.6:2026-08-20(1503) → 2026-08-24(1503) → 本期(1503)(累计 +0

Claude Fable 5:2026-08-20(1494) → 2026-08-24(1495) → 本期(1495)(累计 +1

从近几期走势看,头部位置的争夺集中在个位数 Elo 差距内,单周波动更多来自投票样本量的变化而非能力跃迁——看待周度排名变化时,建议以「趋势方向」而非「具体名次」为准。

六、选型建议

  • 追求能力上限:优先看竞技场 Elo Top 5,这些模型在真实人类盲测偏好中胜率最高;
  • 中文场景优先:SuperCLUE 与综合能力分权重更高的国产头部模型,通常在中文理解与指令遵循上更稳;
  • 成本敏感型应用:从低价模型里挑 Elo 高于中位数的,单位智能的成本能低一个数量级;
  • 长文档 / Agent 场景:先筛上下文长度与智能体维度得分,再看价格。
以上结论基于公开榜单数据,仅供选型参考;正式决策前建议用自己的业务数据做小规模实测。