一、为什么是这三家
六维评分(SuperCLUE 智能体六维能力)覆盖的头部模型几乎全是国产旗舰,其中 Qwen3.8-Max(阿里云)、Kimi K3(月之暗面)、DeepSeek V4 Pro(深度求索)最具代表性:三者都是开源模型、都支持 1M 上下文、都位居 Elo 综合榜前五,是国产大模型「开源 + 长上下文」路线的三条典型路线。本文用同一套六维数据、同一套价格口径,把它们放在一起实测对比。
二、六维能力雷达图
雷达图叠加三家模型在六个维度(数学推理 / 幻觉控制 / 科学推理 / 精确指令遵循 / 智能体编程 / 智能体任务规划)的得分,越靠外越强。一眼可见:三家形状差异巨大,各有明显强项。
逐维度拆解
| 维度 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro |
|---|---|---|---|
| 数学推理 | 77.2 ★ | 71.9 | 77.2 ★ |
| 幻觉控制 | 86.1 | 83.8 | 89.7 ★ |
| 科学推理 | 71.9 ★ | 70.2 | 71.9 ★ |
| 精确指令遵循 | 43.8 ★ | 41.0 | 42.9 |
| 智能体编程 | 68.4 | 75.8 ★ | 63.2 |
| 任务规划 | 90.9 ★ | 84.3 | 85.5 |
读法:★ 为该维度最高分。三个值得注意的点——① DeepSeek V4 Pro 的幻觉控制 89.7 全场最高,且数学与科学推理与 Qwen 并列第一;② Kimi K3 的智能体编程 75.8 领先,是写代码场景的首选;③ 三家「精确指令遵循」都只有 40 上下,是国产旗舰目前的共同短板,需要强约束输出的场景(如格式化的结构化数据)建议在应用层加校验。
三、Elo 综合排名与历史趋势
Elo 来自 LMArena 竞技场,反映真实用户盲测的胜率偏好,是「综合体验」的参考指标。
| 模型 | 当前 Elo | 开源 | 上下文 | SuperCLUE |
|---|---|---|---|---|
| Qwen3.8-Max | 1482 | 开源 | 1000k | 71.5 |
| Kimi K3 | 1476 | 开源 | 1000k | 70.7 |
| DeepSeek V4 Pro | 1451 | 开源 | 1000k | 70.1 |
近三周 Elo 走势:Qwen3.8-Max 从 1492 微降至 1482,Kimi K3 与 DeepSeek V4 Pro 基本持平——三家都已进入稳定期,排名波动主要来自新模型入榜。
四、价格与性价比
价格为公开 API 报价(元 / 百万 tokens,按 1 美元 ≈ 7.2 元换算);性价比 = Elo ÷ 输入价。
| 模型 | 输入价 | 输出价 | 性价比指数 |
|---|---|---|---|
| Qwen3.8-Max | ¥86.4 | ¥259.2 | 124 |
| Kimi K3 | ¥144.0 | ¥720.0 | 74 |
| DeepSeek V4 Pro | ¥21.6 | ¥43.2 | 484 |
DeepSeek V4 Pro 输入价只有 Kimi K3 的 1/6、Qwen3.8-Max 的 1/4,却拿到了接近前者的 Elo——在三家中性价比断层领先。对成本敏感的大规模调用,它是第一顺位。
五、结论:什么场景选谁
- 要 Agent 编排 / 复杂任务规划:选 Qwen3.8-Max——任务规划 90.9 断层第一,配合 1M 上下文做多步工作流最稳;
- 要写代码 / 智能体编程:选 Kimi K3——编程 75.8 领先,编程场景的用户口碑也长期靠前;
- 要便宜又稳 / 大规模调用:选 DeepSeek V4 Pro——幻觉控制 89.7 全场最高,输入仅 ¥21.6、输出 ¥43.2,是三家中性价比之王;
- 强约束输出:三家指令遵循都偏弱,建议加 JSON Schema 校验或后处理,别裸奔;
- 私有化:三家全部开源,许可证与硬件要求见各自仓库,DeepSeek 对推理硬件更友好。
数据口径:六维评分来自 SuperCLUE 智能体六维能力测评;Elo 来自 LMArena;价格为公开 API 报价。完整榜单见排行榜,更多对比可用模型对比工具。