数据说明
本站聚合 LMArena 人类偏好竞技场与 SuperCLUE 中文综合测评的能力得分,叠加各厂商公开 API 定价,覆盖国内外主流 MaaS 模型。以下说明数据从哪来、怎么更新、口径是什么。
数据来源
三个公开数据源,均保留原始链接,标注来源引用
更新机制
- 1每周一 09:30(北京时间)自动更新
榜单数据按固定周期自动刷新:LMArena Elo 来自其公开数据集快照,中文能力与价格来自 SuperCLUE 官方公开测评,其余字段保留上次快照。
- 2有变化才更新
系统对抓取结果与现有数据做逐字段比对(含数值精度归一化),仅在榜单数据实际变化时生成新快照,避免无效更新。
- 3校验后自动发布
新快照生成后自动发布上线,通常几分钟内生效。
- 4数据源故障时保留旧值
任一数据源暂时不可用,系统会跳过该源并保留上次抓取值,榜单不出现空白,故障会在下次更新时自动恢复。
指标口径
- Elo竞技场 Elo 分
来自 LMArena(原 Chatbot Arena)全球匿名盲测投票,采用 Bradley-Terry 模型计算。分数反映真实用户对模型输出的偏好强度,分数越高代表综合体验越好,与"考试分数"无直接换算关系。
- CNSuperCLUE 智能指数
来自 SuperCLUE 中文通用大模型综合测评,覆盖数学推理、科学推理、智能体编程、指令遵循、幻觉控制、任务规划等维度。海外模型若未参加当期测评,展示为参考估算值。
- 综合综合能力分
对 SuperCLUE(2026 年 7 月)公开的六项子维度得分取平均:数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程、智能体任务规划。仅统计当期公布子分的模型;未公布子分或未参加当期测评的模型不参与该列排序,避免以估算值误导选型。
- ¥API 价格
按每百万 tokens 计价,取自各厂商官方定价页。统一以
$1 ≈ ¥7.2汇率换算为人民币展示(美元原价同时保留)。实际计费请以开通时官方价格为准。 - CTX上下文窗口
模型支持的最大输入上下文长度(tokens),以官方技术文档为准;部分模型按同系列/同代产品合理推算并标注 *。
- SPD输出速度
输出吞吐量(tokens/s),取公开测评或厂商公布值的合理估算,不同测试环境下差异较大,仅作横向量级参考。
估算值与精度说明
榜单中带 * 的字段为合理估算值——包括:未公开精确数值的字段(如部分输出速度)、未参加当期中文测评的海外模型得分、以同系列产品推算的上下文长度。估算遵循保守原则,宁缺毋滥,且仅影响单个字段,不影响其他已确认数据。任何字段只要拿到官方精确数值,会在下一次自动更新时替换为准确值。
免责声明:本榜单为第三方聚合展示,非官方发布,与 LMArena、SuperCLUE 及各模型厂商无隶属或合作关系。 数据仅供选型参考与学习交流,正式决策请以各官方发布为准。
许可声明:Elo 数据来自 LMArena 公开数据集( CC BY 4.0 许可, 数据版权归 LMArena 所有);SuperCLUE 数据版权归其所有。本站仅为展示与学习交流用途, 文中提及的模型名称与商标归各自所有者所有。