一、为什么是这三家

六维评分(SuperCLUE 智能体六维能力)覆盖的头部模型几乎全是国产旗舰,其中 Qwen3.8-Max(阿里云)、Kimi K3(月之暗面)、DeepSeek V4 Pro(深度求索)最具代表性:三者都是开源模型、都支持 1M 上下文、都位居 Elo 综合榜前五,是国产大模型「开源 + 长上下文」路线的三条典型路线。本文用同一套六维数据、同一套价格口径,把它们放在一起实测对比。

二、六维能力雷达图

雷达图叠加三家模型在六个维度(数学推理 / 幻觉控制 / 科学推理 / 精确指令遵循 / 智能体编程 / 智能体任务规划)的得分,越靠外越强。一眼可见:三家形状差异巨大,各有明显强项。

数学推理幻觉控制科学推理精确指令遵循智能体编程任务规划Qwen3.8-MaxKimi K3DeepSeek V4 Pro

逐维度拆解

维度Qwen3.8-MaxKimi K3DeepSeek V4 Pro
数学推理77.271.977.2
幻觉控制86.183.889.7
科学推理71.970.271.9
精确指令遵循43.841.042.9
智能体编程68.475.863.2
任务规划90.984.385.5

读法:★ 为该维度最高分。三个值得注意的点——① DeepSeek V4 Pro 的幻觉控制 89.7 全场最高,且数学与科学推理与 Qwen 并列第一;② Kimi K3 的智能体编程 75.8 领先,是写代码场景的首选;③ 三家「精确指令遵循」都只有 40 上下,是国产旗舰目前的共同短板,需要强约束输出的场景(如格式化的结构化数据)建议在应用层加校验。

三、Elo 综合排名与历史趋势

Elo 来自 LMArena 竞技场,反映真实用户盲测的胜率偏好,是「综合体验」的参考指标。

模型当前 Elo开源上下文SuperCLUE
Qwen3.8-Max1482开源1000k71.5
Kimi K31476开源1000k70.7
DeepSeek V4 Pro1451开源1000k70.1
1441145614721487150208-1908-2008-24DeepSeek V4 ProKimi K3Qwen3.8-Max

近三周 Elo 走势:Qwen3.8-Max 从 1492 微降至 1482,Kimi K3 与 DeepSeek V4 Pro 基本持平——三家都已进入稳定期,排名波动主要来自新模型入榜。

四、价格与性价比

价格为公开 API 报价(元 / 百万 tokens,按 1 美元 ≈ 7.2 元换算);性价比 = Elo ÷ 输入价。

模型输入价输出价性价比指数
Qwen3.8-Max¥86.4¥259.2124
Kimi K3¥144.0¥720.074
DeepSeek V4 Pro¥21.6¥43.2484

DeepSeek V4 Pro 输入价只有 Kimi K3 的 1/6、Qwen3.8-Max 的 1/4,却拿到了接近前者的 Elo——在三家中性价比断层领先。对成本敏感的大规模调用,它是第一顺位。

五、结论:什么场景选谁

  • 要 Agent 编排 / 复杂任务规划:选 Qwen3.8-Max——任务规划 90.9 断层第一,配合 1M 上下文做多步工作流最稳;
  • 要写代码 / 智能体编程:选 Kimi K3——编程 75.8 领先,编程场景的用户口碑也长期靠前;
  • 要便宜又稳 / 大规模调用:选 DeepSeek V4 Pro——幻觉控制 89.7 全场最高,输入仅 ¥21.6、输出 ¥43.2,是三家中性价比之王;
  • 强约束输出:三家指令遵循都偏弱,建议加 JSON Schema 校验或后处理,别裸奔;
  • 私有化:三家全部开源,许可证与硬件要求见各自仓库,DeepSeek 对推理硬件更友好。
数据口径:六维评分来自 SuperCLUE 智能体六维能力测评;Elo 来自 LMArena;价格为公开 API 报价。完整榜单见排行榜,更多对比可用模型对比工具