如果把 2026 年 8 月的大模型行业压缩成一件事,那就是两条定价曲线同时出现:一边是 DeepSeek 正式告别「价格屠夫」人设,对旗舰模型实行峰谷定价,输出价最高涨到 27 元/百万 tokens;另一边是智谱、阿里、蚂蚁的 Flash 矩阵集体反向操作,把推理成本压到每 token 只激活 6B 参数,甚至直接开源。用一句话概括:涨价验证真实需求,降本才能换来普惠——这个月,行业第一次同时走完了商业化的 A、B 两面。

一、一涨一降:定价逻辑从「按成本」转向「按价值」

8 月 13 日,DeepSeek 宣布 V4-Flash 与 V4-Pro 自 8 月 17 日起上调价格并实行峰谷定价,其中 V4-Pro 高峰时段输出价由 6 元涨至 27 元/百万 tokens,部分档位涨幅最高约 12 倍。同日,V4-Pro 正式版上线,并发布了 Harness(智能体运行框架)开发者预览版——用更强的 Agent 能力对冲涨价可能带来的流失。

几乎同时,智谱连发 GLM-5.3 与 GLM-5.3-Flash 并双双开源;阿里千问开源 Qwen3.8 系列,其中 Qwen3.8-Flash 每个 token 仅激活 6B 参数,Qwen3.8-27B 家用显卡就能跑。一涨一降,清晰划出了市场分层:头部旗舰在证明「贵有贵的道理」,长尾普惠在赌「便宜才有规模」。

大洋彼岸则在上演反向版本:OpenAI 不到一个月内两次降价,GPT-5.6 Sol 输出价降至 20 美元/百万 tokens;谷歌 Gemini 3.7 Flash 以前代一半的价格首发;Anthropic 干脆取消了原定涨价计划。开源模型的逼近,正迫使闭源巨头把「高端溢价」换成了「基建式定价」。半年前还在比拼谁更贵,如今比拼的是单位 token 的性价比

二、开源海啸:中国模型正在变成「底座」

7 月底,月之暗面把 Kimi K3 的 2.8T 权重全部开源;8 月,智谱 GLM-5.3(总参约 740B、激活 40B)与 GLM-5.3-Flash(即此前以匿名身份走红的「Ox Alpha」)相继开源;美团开源 1.6T 参数的 LongCat-2.0;商汤发布并开源统一多模态模型 SenseNova U1。Hugging Face《开放模型现状:2026 夏季观察》给出的结论更直接:中国开放模型正成为美国千亿参数级大模型的底座

这不再是「开源追平闭源」的叙事,而是「开源成为默认选项」的叙事。OpenRouter 的调用量数据是最好的注脚:上周全球模型调用量前十名中,6 个是国产模型;中国模型的全球调用量已连续 15 周超过美国。

三、Agent 化:竞争从「模型智商」转向「系统能力」

8 月的另一个信号是竞争主轴的变化。阿里 Qwen3.8-Max 冲上 AA Agentic Index 全球第一;DeepSeek 发布 Harness 框架——正如「小冰之父」李笛所言,Claude Code 的模型足够强,仍需要数十万行代码的 Harness 才能在真实场景中端到端可用。模型本身是商品,Agent 才是系统;当大家的智商都够用时,决定胜负的是「环境与约束」——工具调用、任务编排、运行可靠性。

对开发者这意味着:选型不再只看 Elo,还要看模型配套的 Agent 生态、上下文窗口与工具链成熟度。

四、榜单数据印证:格局的三点变化

从 MaaS Rank 最新快照(333 个模型)看,上述趋势已反映在数据里:

1. 开源旗舰进入第一梯队。 198 个模型为开源(占比约 59%),其中 Qwen3.8-Max(Elo 1482)已与 Gemini 3.5 Flash 等闭源模型并驾齐驱,跻身全球前十:

模型厂商Elo开源
Claude Opus 5Anthropic1504
Claude Opus 4.6Anthropic1503
Claude Fable 5Anthropic1495
Gemini 3.7 FlashGoogle1490
Qwen3.8-Max阿里巴巴1482

2. 性价比榜单被国产模型霸榜。 按 Elo ÷ 输入价(基准价)计算,最划算的选择几乎全部来自中国厂商,且开源模型与闭源模型同台竞争:

模型厂商输入价(¥/百万 tokens)Elo性价比
混元 Hy3腾讯7.214411441
DeepSeek V4 Flash深度求索7.214321432
Qwen3.7-Max阿里巴巴9.014741179
Gemini 3.5 FlashGoogle10.81483989
GPT-5.4OpenAI18.01470588

3. 头部竞争进入胶着期。 与 8 月中旬快照相比,头部 Elo 仅小幅波动(Claude Opus 5 由 1508 微降至 1504,Qwen3.8-Max 由 1492 降至 1483),第一名与第五名之间没有代差——差异正从「谁更强」转移到「谁更适合你的场景与预算」。

五、对选型者的三点启示

  • 预算敏感的项目,趁现在锁定 Flash 级模型。 峰谷定价已在头部厂商落地,未来「便宜」很可能不再无条件成立;混元 Hy3、DeepSeek V4 Flash、Qwen3.7-Max 这类基准价在 ¥10/百万 tokens 以内的模型,是当前成本与能力的最佳平衡点。
  • 合规与私有化需求,优先看 8 月新开源的一批。 GLM-5.3、Qwen3.8 系列、Kimi K3 均为可商用开源(注意各自 License 的部署限制),能力已进入第一梯队,私有化不再意味着「降级」。
  • Agent 类应用,把「生态」放进评估项。 Elo 之外,多确认上下文窗口、工具调用质量与官方 Agent 框架支持——8 月各家都在往这里加码,跟得上的厂商才值得长期绑定。

结语。 「参数崇拜」退场,「效率与成本」登场——8 月的两份价目表与一次开源潮,把大模型行业从「谁做得更大」推向了「谁交付得更聪明、更便宜」。对应用开发者而言,这是最不缺选择、也最需要判断力的时刻。


附:8 月大事速览

日期事件影响
8/03阿里 Qwen3.8-Max 登顶 AA Agentic Index开源模型首次登顶全球 Agent 榜单
8/13DeepSeek 宣布峰谷定价,V4-Pro 正式版 + Harness 上线国产旗舰首次公开涨价,Agent 框架成新战场
8/14智谱发布 GLM-5.3(编程能力 +50%),阿里开源 Qwen3.8 系列开源旗舰集中放量
8/17DeepSeek 新价格生效,输出价最高 27 元/百万 tokens「按价值定价」落地
8/18美团开源 LongCat-2.0(1.6T);商汤开源 SenseNova U1更多大厂加入开源
8/26GLM-5.3-Flash 开源(即「Ox Alpha」)Flash 级低成本模型走向开源
8/下旬GPT-5.6 Sol 二度降价;Gemini 3.7 Flash 半价首发美国闭源巨头跟进降价