一、总览:当前综合能力最强的六个模型
以 LMArena 竞技场 Elo 为综合参考(人类盲测偏好),当前排名前六如下。Elo 反映真实对话体验的胜率偏好,适合作为「不知道选谁时」的默认答案。
| # | 模型 | 厂商 | Elo | 开源 | 发布时间 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 1504 | 闭源 | 2026-07 |
| 2 | Claude Opus 4.6 | Anthropic | 1503 | 闭源 | — |
| 3 | Claude Fable 5 | Anthropic | 1495 | 闭源 | — |
| 4 | Gemini 3.7 Flash | 1490 | 闭源 | — | |
| 5 | Claude Opus 4.7 | Anthropic | 1490 | 闭源 | — |
| 6 | Muse Spark 1.2 | Meta | 1487 | 闭源 | — |
总体格局:头部模型分差在 30 分以内,第一名与第五名之间没有代差;真正的差异体现在具体维度上——下面按场景拆开看。
二、代码开发:智能体编程得分 Top 5
代码场景看「智能体编程」维度(模型自主完成编程任务的能力),并参考 Elo 确认整体体验。
| 模型 | 厂商 | 智能体编程 | Elo | 开源 |
|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 75.8 | 1476 | 是 |
| Qwen3.8-Max | 阿里巴巴 | 68.4 | 1482 | 是 |
| GLM-5.2 | 智谱AI | 64.1 | 1465 | 是 |
| DeepSeek V4 Pro | 深度求索 | 63.2 | 1451 | 是 |
| DeepSeek V4 Flash | 深度求索 | 59.0 | 1432 | 是 |
点评:Kimi K3 与 Qwen3.8-Max 是当前国产阵营的编程第一梯队;需要离线部署时 DeepSeek V4 Flash 性价比更高(详见场景五、六)。
三、数学推理:数学得分 Top 5
数学推理维度衡量解题、证明与逻辑推导能力,对科研、量化、教育类应用最关键。
| 模型 | 厂商 | 数学推理 | 科学推理 | Elo |
|---|---|---|---|---|
| DeepSeek V4 Flash | 深度求索 | 79.0 | 70.2 | 1432 |
| Qwen3.8-Max | 阿里巴巴 | 77.2 | 71.9 | 1482 |
| DeepSeek V4 Pro | 深度求索 | 77.2 | 71.9 | 1451 |
| 混元 Hy3 | 腾讯 | 77.2 | 75.4 | 1441 |
| Doubao Seed 2.1 Pro | 字节跳动 | 75.4 | 77.2 | 1410 |
点评:DeepSeek 系列在数学上表现稳定,V4 Flash 与 V4 Pro 双双进入前列;混元 Hy3 数学与科学均衡,适合需要兼顾两者的场景。
四、中文场景与指令遵循:精确指令遵循 Top 5
中文业务(客服、写作、内容生成)更看重「精确指令遵循」——按用户要求执行而不跑偏,同时参考 SuperCLUE 中文综合分。
| 模型 | 厂商 | 精确指令遵循 | SuperCLUE | Elo |
|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 43.8 | 71.5 | 1482 |
| DeepSeek V4 Pro | 深度求索 | 42.9 | 70.1 | 1451 |
| Doubao Seed 2.1 Pro | 字节跳动 | 42.9 | 65.9 | 1410 |
| ERNIE 5.1 | 百度 | 41.9 | 54.6 | 1468 |
| Kimi K3 | 月之暗面 | 41.0 | 70.7 | 1476 |
点评:Qwen3.8-Max 指令遵循与中文综合分双高,是中文业务场景的稳妥选择;DeepSeek V4 Pro 与 Doubao Seed 2.1 Pro 紧随其后,可结合价格取舍。
五、Agent 应用:智能体任务规划 Top 5
Agent / 工作流场景关注「智能体任务规划」维度(拆解任务、调用工具、多步执行),并搭配长上下文支持复杂会话。
| 模型 | 厂商 | 智能体任务规划 | 上下文 | Elo |
|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 90.9 | 1000k | 1482 |
| DeepSeek V4 Pro | 深度求索 | 85.5 | 1000k | 1451 |
| Doubao Seed 2.1 Pro | 字节跳动 | 85.0 | 1000k | 1410 |
| Kimi K3 | 月之暗面 | 84.3 | 1000k | 1476 |
| DeepSeek V4 Flash | 深度求索 | 80.7 | 1000k | 1432 |
点评:Qwen3.8-Max 的任务规划得分接近 91,配合 1M 上下文,是目前做 Agent 编排最顺手的国产模型之一;DeepSeek V4 Pro、Kimi K3 也值得纳入候选。
六、性价比之选:单位成本获得的智能最高
用 Elo ÷ 输入价格(元/百万 tokens)衡量「每花一块钱买到多少智能」,适合成本敏感的生产环境与大规模调用。
| 模型 | 厂商 | 输入价 | 输出价 | Elo | 性价比 |
|---|---|---|---|---|---|
| Llama 4 Maverick | Meta | ¥1.94 | ¥6.12 | 1288 | 4770 |
| 混元 Hy3 | 腾讯 | ¥7.2 | ¥28.8 | 1441 | 1441 |
| DeepSeek V4 Flash | 深度求索 | ¥7.2 | ¥14.4 | 1432 | 1432 |
| Qwen3.7-Max | 阿里巴巴 | ¥9.0 | ¥27.0 | 1474 | 1179 |
| Gemini 3.5 Flash | ¥10.8 | ¥64.8 | 1483 | 989 | |
| Gemini 3.1 Pro | ¥14.4 | ¥86.4 | 1480 | 740 |
点评:DeepSeek V4 Flash 以 ¥7.2/百万 tokens 的输入价拿到 1432 的 Elo,是「便宜又够强」的代表;混元 Hy3 同样是一块钱级别里能力最均衡的选项。注:部分低价开源模型(如 Llama 4 Maverick)Elo 偏低,适合非关键路径使用。
七、开源私有化:可自部署的模型 Top 6
数据合规或成本控制需要私有化部署时,开源模型是唯一选择。按 Elo 排序如下,部署前注意核对许可证与硬件要求。
| 模型 | 厂商 | Elo | 上下文 | 发布时间 |
|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 1482 | 1000k | 2026-08 |
| GLM 5.3 | 智谱 | 1477 | — | — |
| Kimi K3 | 月之暗面 | 1476 | 1000k | 2026-06 |
| GLM-5.2 | 智谱AI | 1465 | 1000k | 2026-07 |
| MiMo V2.5 Pro | 小米 | 1465 | 256k | 2026-06 |
| GLM 5.1 | 智谱 | 1464 | — | — |
点评:开源阵营国产占优——Qwen3.8-Max、GLM 5.3、Kimi K3 分列前三;NVIDIA Nemotron 3 Ultra 与 Gemma 4 31b 则是海外开源的代表,适合英文为主的场景。
八、怎么用这份指南
- 按场景定位:先确认你的核心场景(代码 / 数学 / 中文 / Agent),看对应榜单;
- 再看成本:同场景内用性价比榜单二次筛选;
- 数据在更新:本指南随榜单数据每周自动刷新,模型价格与排名变动会同步体现;
- 上线前实测:正式项目请用自己的业务数据做小规模 A/B 测试。
数据口径:Elo 来自 LMArena 竞技场,六维评分与 SuperCLUE 来自 SuperCLUE 测评;价格为公开 API 报价,按 1 美元 ≈ 7.2 元换算。榜单实时快照见排行榜。