前言
2026 年 7 月 31 日,DeepSeek 把 DeepSeek-V4-Flash 从 Preview 推到了 GA(正式版)。模型字符串没变,端点没变,价格没变——输入 $0.14/1M、cache hit $0.0028、输出 $0.28/1M,跟 Preview 一模一样。
但如果只看价格和端点,你会错过这件事真正有意思的地方。
官方 changelog 写着:Flash 的 agent 能力,大幅超过了 V4-Pro-Preview。在 Terminal Bench 2.1、DeepSWE、Toolathlon、NL2Repo、Cybergym 这些 agent 评测上,一个 13B 激活 / 284B 总参的紧凑 MoE 模型,把 49B 激活的 Pro-Preview 干掉了。
这事如果发生在别的厂商身上,可能就是一个常规更新。但发生在 DeepSeek 身上,值得停下来想一下——因为它讲了一个关于"模型之争下一站在哪"的故事。
一、架构没动,能力却跳了——post-training 的"暗功夫"
DeepSeek 在 changelog 里写得很直白:这次只重做了 post-training,架构没动,参数没动。V4-Flash 还是那个 284B 总参 / 13B 激活 / MoE / 1M 上下文的骨架。
这件事为什么重要?因为过去三年,AI 行业默认的进步方式是"把模型做得更大"——堆参数、堆数据、堆算力。每一次"下一代模型"发布,几乎都伴随着参数规模的跳跃。从 GPT-3 的 175B,到 GPT-4 的传闻万亿参,再到 Llama 4 Behemoth 的 2T,行业默认的 KPI 就是"更大"。
而 DeepSeek 这次干的,正好反过来:在不动参数规模的前提下,只把 post-training 做重做透,就能把 agent 能力拉到旗舰级别。
什么是 post-training?简单说就是"预训练完之后的所有事"——监督微调(SFT)、强化学习(RLHF/RLAIF)、推理增强(o1-style 的慢思考训练)、agent 工具使用训练、还有最近很火的"在 agent harness 里跑大量真实任务"的迭代。
以前这部分被认为是"锦上添花"——大家默认预训练才是真功夫,post-training 只是把已经聪明的模型"调教得听话"。但 DeepSeek 这件事,加上过去半年 Moonshot、Z.ai、阿里各家都在做的"post-training 大改造",讲的是另一个故事:
当预训练数据已经被各家吃透、scaling law 边际收益开始递减的时候,post-training 的"暗功夫"开始变成新的主战场。
IBM 的 Peter Staar 在 2026 年初说过一句话,大意是:"大家都开始对单纯堆参数感到疲倦,正在寻找新想法。" DeepSeek 这次发布,就是这句话的最佳注脚。
这也解释了为什么官方公布的 agent 评测里,Flash 反超的不只是"便宜",而是在每一个 agent 维度上都反超——Terminal Bench 2.1 拿了 82.7,Cybergym 拿了 76.7,Toolathlon 拿了 70.3。这些是"长链路、多工具、真实任务"的评测,不是刷 benchmark 能刷出来的分数。
二、涨价前夜,谁还在押注紧凑模型
这篇文章 8 月 7 日上线时,DeepSeek 在 8 月 6 日刚刚发了涨价公告。官方在定价页挂出通知:计划近期整体上调 API 服务定价,预计涨幅较大,具体方案以正式通知为准——没幅度,没日期。
公告出来一天之内,Bloomberg、SCMP、新浪、搜狐、腾讯新闻全部跟进了这条消息。一家以"白菜价"立身的公司突然说要"大幅涨价",这件事的信号强度远超通知本身——这意味着国产大模型"靠爱发电"的时代,可能真的要结束了。
为什么是现在?官方给出的三大原因:需求爆炸(V4-Flash 单日 token 消耗冲到 8 万亿)、算力吃紧(高端 AI 芯片产能受限,腾讯云一个月内连续两次涨价)、行业回归理性(OpenAI、谷歌、Anthropic 都已经调过一轮)。OpenRouter 的 token 用量一年翻了 10 倍,国内日均 token 调用量已经到 140 万亿——这些数字单独看都还好,放在一起意味着 AI Agent 这个赛道,对算力的真实消耗远超所有人一年前的预期。
涨价公告发出后,当前价格仍然是 $0.14/1M 输入(缓存命中 $0.0028)、$0.28/1M 输出——和 Preview 时代一模一样。这篇文章里的数字,都是按现价算的。但要承认一件事:这个价格窗口什么时候关上,谁也不知道。
同时引入的峰谷定价也值得关注:高峰时段(北京时间 9:00-12:00、14:00-18:00)价格翻 2 倍,平峰不变。这意味着 agent 任务调度需要开始考虑"错峰"——以前只算"贵不贵",以后还要算"什么时候跑"。
涨价前,大家讨论的是 "agent 跑一次几美分,以前是几美元"——这是 agent 项目 ROI 算得过来的关键。涨价后,这个判断不能无条件成立了。但有一件事仍然成立:第一章讲的"13B 激活反超 49B 激活",跟涨不涨价无关。能力反超是 post-training 的事实,价格只是商业决策。
也就是说,涨价公告动摇的是"agent 默认走便宜模型"的商业判断,不动摇"紧凑模型在 agent 维度能反超旗舰"的技术判断。这两件事要分开看。
三、为什么这个月所有 AI 公司都在"卷紧凑模型"
DeepSeek 这次不是孤例。如果你把这个月各家发布过一遍,你会看到一个非常一致的趋势:
1. Moonshot 的 Kimi K3(2026 年 7 月 16 日发布,7 月 27 日放权重)
2.8 万亿总参数 / 104B 激活的 MoE 模型,1M 上下文,native vision,MIT 协议开放权重。在 Frontend Code Arena 直接登顶 Elo 1679,把 Claude Fable 5 和 GPT-5.6 Sol 都甩在后面——这是第一个在开放权重模型里把这两个闭源旗舰干掉的。
但 Kimi K3 真正的看点不是参数(2.8T 听着吓人,但每 token 只激活 16/896 个 expert,实际算力是受控的),而是它在前端代码生成这个最难 agent 任务上的突破——以前前端代码生成被认为是"闭源模型的护城河",Kimi K3 这次证明开放权重也能打。
2. Z.ai 的 GLM-5.1 / GLM-5.2(2026 年 4 月 / 6 月)
GLM-5.1 主打"长任务对齐",能在一个工程任务上维持 8 小时对齐、跑上千次工具调用。GLM-5.2 在 1M 上下文下专门优化了长任务能力,在 MCP-Atlas、Tool-Decathlon 这些新一代 agent 评测上反超 GLM-5.1 大幅。
Z.ai 这次用的是 MIT 协议,模型权重完全开放,而且他们专门为长任务 agent这个以前被忽视的维度做了优化——这跟 DeepSeek 这次"用 post-training 重做 agent"是完全一致的思路。
3. 阿里的 Qwen3-Coder-Next(2026 年初)
80B 参数的稀疏 MoE,256K 上下文,能跑在消费级硬件上。这是另一个反直觉的点——以前我们觉得"agent 模型必须大",Qwen3-Coder-Next 证明了"跑得动的本地模型也能做 agent"。
这三个发布加上 DeepSeek 的 V4-Flash,讲的是同一件事:
2026 年下半年,模型之争的主战场不再是"参数更大",而是"agent 更好"——具体说,是"用更小的激活参数、更便宜的价格,做到更强的 agent 能力"。
这个趋势对普通开发者和企业 AI 项目意味着什么?三件事:
第一,"AI Agent 太贵了"这件事正在变便宜。以前企业里跑一个 agent demo 要算 ROI,现在很多场景下 ROI 已经能算过来了——agent 跑一次任务几美分,以前是几美元。
第二,"默认最强模型"这个习惯开始松动。以前大家写代码就是 "Claude Opus 一把梭",现在开始变成"用 Flash 跑 80% 的任务,只对最难的 20% 上 Pro 或 Opus"——这种模型分级的设计会越来越主流。
第三,"开放权重 vs 闭源"的差距在快速收窄。以前开放权重模型是"能力不够、便宜来凑",现在开始变成"能力也不差了,而且便宜"。Kimi K3 在前端代码生成上干掉了 Fable 5 / GPT-5.6 Sol,是一个标志性事件。
写在最后
DeepSeek 这次发布最值得记住的不是数字,而是它讲了一个什么故事——
在过去三年里,"模型更大 = 模型更强"这件事几乎成了行业信仰。每一次下一代模型发布,大家第一反应都是看参数量。每一次融资,大家第一反应都是问"你们要堆到几 T"。
而 2026 年下半年开始的这一切,正在悄悄打破这个信仰。
"更大"当然还有用——Kimi K3 2.8T、GLM-5 744B、DeepSeek V4-Pro 1.6T,这些数字本身还是有意义的。但它们的边际收益开始递减了,而 post-training / agent 训练 / 长任务对齐的边际收益正在变陡。
这件事对大模型公司来说,是一个值得警惕的信号。过去三年大家赖以生存的"更大 = 更强"叙事,正在被打破。
而对普通开发者来说,这是一个好消息——AI 终于开始变得真正用得起了。
参考资料:DeepSeek 官方 changelog (2026-07-31) / DeepSeek-V4-Flash-0731 model card / Kimi K3 技术报告 (Moonshot AI, 2026-07) / GLM-5.2 技术报告 (Z.ai, 2026-06) / IBM Think 2026 AI 趋势预测。