一、格局总览:头部十家厂商
截至本期数据,榜单共收录 333 款模型、来自 32 个厂商分类(含「其他/未归类」)。按模型数量排序,前十名如下——款数代表覆盖面,平均 Elo 代表整体实力,最强模型则决定厂商的天花板,三列结合看才完整。
| # | 厂商 | 模型数 | 开源 | 平均 Elo | 最强模型 | Elo |
|---|---|---|---|---|---|---|
| 1 | 阿里云 | 37 | 28 | 1325.0 | Qwen3.5 | 1471 |
| 2 | 35 | 13 | 1300.0 | Gemini 3.7 Flash | 1490 | |
| 3 | OpenAI | 33 | 2 | 1369.7 | GPT-5.5 | 1471 |
| 4 | Anthropic | 21 | 0 | 1392.4 | Claude Opus 5 | 1504 |
| 5 | Meta | 21 | 18 | 1211.9 | Muse Spark 1.2 | 1487 |
| 6 | xAI | 14 | 0 | 1402.4 | Grok 4.5 | 1452 |
| 7 | 智谱 | 13 | 10 | 1394.5 | GLM 5.3 | 1477 |
| 8 | Mistral AI | 13 | 11 | 1249.5 | Mistral Large 3 | 1428 |
| 9 | NVIDIA | 11 | 11 | 1300.0 | NVIDIA Nemotron 3 Ul… | 1445 |
| 10 | 腾讯 | 8 | 1 | 1345.0 | 混元 Hy3 | 1441 |
整体格局:中国厂商在规模与开源上领先(阿里云 37 款居首),海外厂商在单点能力上更强(Anthropic 的 Claude Opus 5 以 1504 Elo 登顶全榜);而平均实力榜上,小米、月之暗面、xAI 等「小而精」的玩家反超了大厂——数量不再是衡量厂商的唯一标准。
二、重点厂商逐个盘点
以下 12 家厂商覆盖了榜单绝大多数的头部模型,按规模排序展开。
以 37 款模型位列全站模型数量第一,是榜单覆盖最广的厂商;28 款开源,开源占比 76%,生态开放程度高;平均 Elo 1325.0,中坚力量;旗舰为 Qwen3.5(Elo 1471)。
35 款模型位居数量前三;少数开源(13 款),以闭源商用为主;平均 Elo 1300.0,中坚力量;旗舰为 Gemini 3.7 Flash(Elo 1490)。
33 款模型位居数量前三;少数开源(2 款),以闭源商用为主;平均 Elo 1369.7,中坚力量;旗舰为 GPT-5.5(Elo 1471)。
21 款模型的规模处于第一梯队;全系闭源,走商业 API 路线;平均 Elo 1392.4,属「少而精」路线;旗舰为 Claude Opus 5(Elo 1504)。
21 款模型的规模处于第一梯队;18 款开源,开源占比 86%,生态开放程度高;平均 Elo 1211.9,更侧重覆盖面与细分场景;旗舰为 Muse Spark 1.2(Elo 1487)。
14 款模型的规模处于第一梯队;全系闭源,走商业 API 路线;平均 Elo 1402.4,属「少而精」路线;旗舰为 Grok 4.5(Elo 1452)。
13 款模型的规模相对克制;10 款开源,开源占比 77%,生态开放程度高;平均 Elo 1394.5,属「少而精」路线;旗舰为 GLM 5.3(Elo 1477)。
8 款模型的规模相对克制;少数开源(1 款),以闭源商用为主;平均 Elo 1345.0,中坚力量;旗舰为 混元 Hy3(Elo 1441)。
8 款模型的规模相对克制;8 款开源,开源占比 100%,生态开放程度高;平均 Elo 1332.1,中坚力量;旗舰为 DeepSeek R1(Elo 1428)。
6 款模型的规模相对克制;6 款开源,开源占比 100%,生态开放程度高;平均 Elo 1431.5,属「少而精」路线;旗舰为 Kimi K3(Elo 1476)。
5 款模型的规模相对克制;3 款开源,开源占比 60%,生态开放程度高;平均 Elo 1432.4,属「少而精」路线;旗舰为 MiMo V2.5 Pro(Elo 1465)。
5 款模型的规模相对克制;5 款开源,开源占比 100%,生态开放程度高;平均 Elo 1367.8,中坚力量;旗舰为 MiniMax M2.7(Elo 1405)。
三、全部厂商一览
其余厂商(Mistral AI、NVIDIA、Allenai、Cohere、Microsoft、Ibm、Amazon、阶跃星辰等)模型数量较少,详见下表。
| # | 厂商 | 模型数 | 开源 | 平均 Elo | 最强模型 | Elo |
|---|---|---|---|---|---|---|
| 1 | 阿里云 | 37 | 28 | 1325.0 | Qwen3.5 | 1471 |
| 2 | 35 | 13 | 1300.0 | Gemini 3.7 Flash | 1490 | |
| 3 | OpenAI | 33 | 2 | 1369.7 | GPT-5.5 | 1471 |
| 4 | Anthropic | 21 | 0 | 1392.4 | Claude Opus 5 | 1504 |
| 5 | Meta | 21 | 18 | 1211.9 | Muse Spark 1.2 | 1487 |
| 6 | xAI | 14 | 0 | 1402.4 | Grok 4.5 | 1452 |
| 7 | 智谱 | 13 | 10 | 1394.5 | GLM 5.3 | 1477 |
| 8 | Mistral AI | 13 | 11 | 1249.5 | Mistral Large 3 | 1428 |
| 9 | NVIDIA | 11 | 11 | 1300.0 | NVIDIA Nemotron 3 Ul… | 1445 |
| 10 | 腾讯 | 8 | 1 | 1345.0 | 混元 Hy3 | 1441 |
| 11 | DeepSeek | 8 | 8 | 1332.1 | DeepSeek R1 | 1428 |
| 12 | Allenai | 8 | 8 | 1234.2 | Olmo 3.1 32b Instruc… | 1311 |
| 13 | Cohere | 7 | 7 | 1217.6 | Command A 03 | 1331 |
| 14 | Microsoft | 7 | 7 | 1116.4 | Phi 4 | 1217 |
| 15 | 月之暗面 | 6 | 6 | 1431.5 | Kimi K3 | 1476 |
| 16 | Ibm | 6 | 6 | 1164.7 | Granite 4.1 8b | 1292 |
| 17 | 小米 | 5 | 3 | 1432.4 | MiMo V2.5 Pro | 1465 |
| 18 | MiniMax | 5 | 5 | 1367.8 | MiniMax M2.7 | 1405 |
| 19 | Amazon | 5 | 0 | 1301.2 | Amazon Nova Experime… | 1447 |
| 20 | 阶跃星辰 | 4 | 2 | 1352.5 | Step 3.5 Flash | 1404 |
| 21 | 阿里巴巴 | 2 | 1 | 1478.0 | Qwen3.8-Max | 1482 |
| 22 | 百度 | 2 | 0 | 1456.0 | ERNIE 5.1 | 1468 |
| 23 | 深度求索 | 2 | 2 | 1441.5 | DeepSeek V4 Pro | 1451 |
| 24 | 字节跳动 | 2 | 0 | 1429.0 | Dola Seed 2.0 Pro | 1448 |
| 25 | Thinky | 2 | 2 | 1425.5 | Inkling | 1439 |
| 26 | Ant-Group | 2 | 2 | 1347.5 | Ling Flash 2.0 | 1363 |
| 27 | Inception-Ai | 2 | 0 | 1320.0 | Mercury 2 | 1358 |
| 28 | 智谱AI | 1 | 1 | 1465.0 | GLM-5.2 | 1465 |
| 29 | 稀宇科技 | 1 | 1 | 1435.0 | MiniMax M3 | 1435 |
| 30 | 美团 | 1 | 0 | 1426.0 | LongCat Flash Chat | 1426 |
| 31 | Upstage | 1 | 0 | 1376.0 | Solar Pro4 | 1376 |
四、怎么用这份盘点
- 选供应商:追求能力天花板看「最强模型」,追求稳定输出看「平均 Elo」,追求生态看「模型数 + 开源数」;
- 国产 vs 海外:数据合规敏感选阿里云 / 智谱 / DeepSeek 等国产厂商;英文场景 OpenAI / Anthropic / Google 仍有优势;
- 私有化部署:优先看开源占比高的厂商(DeepSeek、智谱、Meta、Mistral),部署成本可控;
- 数据在更新:本盘点随榜单数据每周自动刷新,厂商发布新模型后格局会同步变化。
数据口径:Elo 来自 LMArena 竞技场;「平均 Elo」为厂商所有已评模型 Elo 的算术平均,仅作整体实力参考。榜单实时快照见排行榜。