本期(2026-09-01)榜单共收录 333 个模型;竞技场方面,Claude Opus 5(Anthropic)以 1504 的 Elo 分继续领跑;中文能力上,Gemini 3.1 Pro 的 SuperCLUE 智能指数为 75.7;综合能力分(SuperCLUE 六维均值)第一为 Qwen3.8-Max(73.06 分);最便宜的模型是 Llama 4 Maverick,输入价格 ¥1.94 / 百万 tokens。
一、榜单总览
先看竞技场 Elo Top 10(点击模型名可进入详情页查看六维能力与历史趋势):
| 排名 | 模型 | 厂商 | Elo | SuperCLUE | 综合能力 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 1504 | 75.0 | — |
| 2 | Claude Opus 4.6 | Anthropic | 1503 | — | — |
| 3 | Claude Fable 5 | Anthropic | 1495 | — | — |
| 4 | Gemini 3.7 Flash | 1490 | — | — | |
| 5 | Claude Opus 4.7 | Anthropic | 1490 | — | — |
| 6 | Muse Spark 1.2 | Meta | 1487 | — | — |
| 7 | Gemini 3.5 Flash | 1483 | 71.5 | — | |
| 8 | Qwen3.8-Max | 阿里巴巴 | 1482 | 71.5 | 73.1 |
| 9 | Gemini 3.1 Pro | 1480 | 75.7 | — | |
| 10 | Gemini 3 Pro | 1479 | — | — |
二、本周变化:榜单进入稳定期
与上一期(2026-09-01)快照相比,本期榜单的 Elo 排名、SuperCLUE 得分与 API 价格均未发生变化。这通常意味着两件事:其一,LMArena 官方未发布新的 Elo 快照(竞技场数据为不定期更新);其二,各厂商处于发版间歇期,没有新模型入榜或调价。
稳定期恰恰是做「横评」的好窗口——排名不再频繁跳动,同一套数据下的模型对比结论更耐得住推敲。推荐使用模型对比工具,把关注的两三个模型拉到同一张雷达图下看六维差异。
三、综合能力看点:六维数据说明了什么
综合能力分取 SuperCLUE 六个维度的平均分,本期前三名:
Qwen3.8-Max(阿里巴巴)—— 73.06 分
| 数学推理 77.19 | 幻觉控制 86.08 | 科学推理 71.93 | 精确指令遵循 43.81 | 智能体编程 68.42 | 智能体任务规划 90.94 |
DeepSeek V4 Pro(深度求索)—— 71.72 分
| 数学推理 77.19 | 幻觉控制 89.73 | 科学推理 71.93 | 精确指令遵循 42.86 | 智能体编程 63.16 | 智能体任务规划 85.48 |
Kimi K3(月之暗面)—— 71.18 分
| 数学推理 71.93 | 幻觉控制 83.85 | 科学推理 70.17 | 精确指令遵循 40.95 | 智能体编程 75.79 | 智能体任务规划 84.35 |
几点观察:
- 头部差距很小:前三名分差在 2 分以内,选型时不必迷信「第一名」,维度强弱比总分更值得关注;
- 维度差异才是选型依据:重数学/科学推理的场景看推理维度,做 Agent 应用重点看智能体编程与任务规划两项;
- 注意口径:海外模型若未参加当期 SuperCLUE 测评,榜单展示为参考估算值,横向对比时请留意标注。
四、价格动向:谁的性价比更高
当前输入价格最低的五个模型(输入 / 输出,每百万 tokens,按 1 美元 ≈ 7.2 元换算):
| 模型 | 厂商 | 输入 / 输出价 | 开源 |
|---|---|---|---|
| Llama 4 Maverick | Meta | ¥1.94 / ¥6.12 | 开源 |
| 混元 Hy3 | 腾讯 | ¥7.2 / ¥28.8 | 开源 |
| DeepSeek V4 Flash | 深度求索 | ¥7.2 / ¥14.4 | 开源 |
| Qwen3.7-Max | 阿里巴巴 | ¥9.0 / ¥27.0 | 闭源 |
| Gemini 3.5 Flash | ¥10.8 / ¥64.8 | 闭源 |
本周各厂商定价无变化。整体来看,头部模型的价格战已阶段性趋缓,「降价换量」的窗口期在收窄,按当前价格做年度成本测算风险不大。
五、历史趋势:头部模型 Elo 走势
Claude Opus 5:2026-08-19(1508) → 2026-08-20(1505) → 2026-08-24(1504) → 本期(1504)(累计 -4)
Claude Opus 4.6:2026-08-20(1503) → 2026-08-24(1503) → 本期(1503)(累计 +0)
Claude Fable 5:2026-08-20(1494) → 2026-08-24(1495) → 本期(1495)(累计 +1)
从近几期走势看,头部位置的争夺集中在个位数 Elo 差距内,单周波动更多来自投票样本量的变化而非能力跃迁——看待周度排名变化时,建议以「趋势方向」而非「具体名次」为准。
六、选型建议
- 追求能力上限:优先看竞技场 Elo Top 5,这些模型在真实人类盲测偏好中胜率最高;
- 中文场景优先:SuperCLUE 与综合能力分权重更高的国产头部模型,通常在中文理解与指令遵循上更稳;
- 成本敏感型应用:从低价模型里挑 Elo 高于中位数的,单位智能的成本能低一个数量级;
- 长文档 / Agent 场景:先筛上下文长度与智能体维度得分,再看价格。
以上结论基于公开榜单数据,仅供选型参考;正式决策前建议用自己的业务数据做小规模实测。