如果把 2026 年 8 月的大模型行业压缩成一件事,那就是两条定价曲线同时出现:一边是 DeepSeek 正式告别「价格屠夫」人设,对旗舰模型实行峰谷定价,输出价最高涨到 27 元/百万 tokens;另一边是智谱、阿里、蚂蚁的 Flash 矩阵集体反向操作,把推理成本压到每 token 只激活 6B 参数,甚至直接开源。用一句话概括:涨价验证真实需求,降本才能换来普惠——这个月,行业第一次同时走完了商业化的 A、B 两面。
一、一涨一降:定价逻辑从「按成本」转向「按价值」
8 月 13 日,DeepSeek 宣布 V4-Flash 与 V4-Pro 自 8 月 17 日起上调价格并实行峰谷定价,其中 V4-Pro 高峰时段输出价由 6 元涨至 27 元/百万 tokens,部分档位涨幅最高约 12 倍。同日,V4-Pro 正式版上线,并发布了 Harness(智能体运行框架)开发者预览版——用更强的 Agent 能力对冲涨价可能带来的流失。
几乎同时,智谱连发 GLM-5.3 与 GLM-5.3-Flash 并双双开源;阿里千问开源 Qwen3.8 系列,其中 Qwen3.8-Flash 每个 token 仅激活 6B 参数,Qwen3.8-27B 家用显卡就能跑。一涨一降,清晰划出了市场分层:头部旗舰在证明「贵有贵的道理」,长尾普惠在赌「便宜才有规模」。
大洋彼岸则在上演反向版本:OpenAI 不到一个月内两次降价,GPT-5.6 Sol 输出价降至 20 美元/百万 tokens;谷歌 Gemini 3.7 Flash 以前代一半的价格首发;Anthropic 干脆取消了原定涨价计划。开源模型的逼近,正迫使闭源巨头把「高端溢价」换成了「基建式定价」。半年前还在比拼谁更贵,如今比拼的是单位 token 的性价比。
二、开源海啸:中国模型正在变成「底座」
7 月底,月之暗面把 Kimi K3 的 2.8T 权重全部开源;8 月,智谱 GLM-5.3(总参约 740B、激活 40B)与 GLM-5.3-Flash(即此前以匿名身份走红的「Ox Alpha」)相继开源;美团开源 1.6T 参数的 LongCat-2.0;商汤发布并开源统一多模态模型 SenseNova U1。Hugging Face《开放模型现状:2026 夏季观察》给出的结论更直接:中国开放模型正成为美国千亿参数级大模型的底座。
这不再是「开源追平闭源」的叙事,而是「开源成为默认选项」的叙事。OpenRouter 的调用量数据是最好的注脚:上周全球模型调用量前十名中,6 个是国产模型;中国模型的全球调用量已连续 15 周超过美国。
三、Agent 化:竞争从「模型智商」转向「系统能力」
8 月的另一个信号是竞争主轴的变化。阿里 Qwen3.8-Max 冲上 AA Agentic Index 全球第一;DeepSeek 发布 Harness 框架——正如「小冰之父」李笛所言,Claude Code 的模型足够强,仍需要数十万行代码的 Harness 才能在真实场景中端到端可用。模型本身是商品,Agent 才是系统;当大家的智商都够用时,决定胜负的是「环境与约束」——工具调用、任务编排、运行可靠性。
对开发者这意味着:选型不再只看 Elo,还要看模型配套的 Agent 生态、上下文窗口与工具链成熟度。
四、榜单数据印证:格局的三点变化
从 MaaS Rank 最新快照(333 个模型)看,上述趋势已反映在数据里:
1. 开源旗舰进入第一梯队。 198 个模型为开源(占比约 59%),其中 Qwen3.8-Max(Elo 1482)已与 Gemini 3.5 Flash 等闭源模型并驾齐驱,跻身全球前十:
| 模型 | 厂商 | Elo | 开源 |
|---|---|---|---|
| Claude Opus 5 | Anthropic | 1504 | 否 |
| Claude Opus 4.6 | Anthropic | 1503 | 否 |
| Claude Fable 5 | Anthropic | 1495 | 否 |
| Gemini 3.7 Flash | 1490 | 否 | |
| Qwen3.8-Max | 阿里巴巴 | 1482 | 是 |
2. 性价比榜单被国产模型霸榜。 按 Elo ÷ 输入价(基准价)计算,最划算的选择几乎全部来自中国厂商,且开源模型与闭源模型同台竞争:
| 模型 | 厂商 | 输入价(¥/百万 tokens) | Elo | 性价比 |
|---|---|---|---|---|
| 混元 Hy3 | 腾讯 | 7.2 | 1441 | 1441 |
| DeepSeek V4 Flash | 深度求索 | 7.2 | 1432 | 1432 |
| Qwen3.7-Max | 阿里巴巴 | 9.0 | 1474 | 1179 |
| Gemini 3.5 Flash | 10.8 | 1483 | 989 | |
| GPT-5.4 | OpenAI | 18.0 | 1470 | 588 |
3. 头部竞争进入胶着期。 与 8 月中旬快照相比,头部 Elo 仅小幅波动(Claude Opus 5 由 1508 微降至 1504,Qwen3.8-Max 由 1492 降至 1483),第一名与第五名之间没有代差——差异正从「谁更强」转移到「谁更适合你的场景与预算」。
五、对选型者的三点启示
- 预算敏感的项目,趁现在锁定 Flash 级模型。 峰谷定价已在头部厂商落地,未来「便宜」很可能不再无条件成立;混元 Hy3、DeepSeek V4 Flash、Qwen3.7-Max 这类基准价在 ¥10/百万 tokens 以内的模型,是当前成本与能力的最佳平衡点。
- 合规与私有化需求,优先看 8 月新开源的一批。 GLM-5.3、Qwen3.8 系列、Kimi K3 均为可商用开源(注意各自 License 的部署限制),能力已进入第一梯队,私有化不再意味着「降级」。
- Agent 类应用,把「生态」放进评估项。 Elo 之外,多确认上下文窗口、工具调用质量与官方 Agent 框架支持——8 月各家都在往这里加码,跟得上的厂商才值得长期绑定。
结语。 「参数崇拜」退场,「效率与成本」登场——8 月的两份价目表与一次开源潮,把大模型行业从「谁做得更大」推向了「谁交付得更聪明、更便宜」。对应用开发者而言,这是最不缺选择、也最需要判断力的时刻。
附:8 月大事速览
| 日期 | 事件 | 影响 |
|---|---|---|
| 8/03 | 阿里 Qwen3.8-Max 登顶 AA Agentic Index | 开源模型首次登顶全球 Agent 榜单 |
| 8/13 | DeepSeek 宣布峰谷定价,V4-Pro 正式版 + Harness 上线 | 国产旗舰首次公开涨价,Agent 框架成新战场 |
| 8/14 | 智谱发布 GLM-5.3(编程能力 +50%),阿里开源 Qwen3.8 系列 | 开源旗舰集中放量 |
| 8/17 | DeepSeek 新价格生效,输出价最高 27 元/百万 tokens | 「按价值定价」落地 |
| 8/18 | 美团开源 LongCat-2.0(1.6T);商汤开源 SenseNova U1 | 更多大厂加入开源 |
| 8/26 | GLM-5.3-Flash 开源(即「Ox Alpha」) | Flash 级低成本模型走向开源 |
| 8/下旬 | GPT-5.6 Sol 二度降价;Gemini 3.7 Flash 半价首发 | 美国闭源巨头跟进降价 |