一、彼时与纷纷跟进布局这一效率架构路线
变化可以从7月份的一个发布日开始追溯,7月21日,Google DeepMind一口气端出三款Flash模型,但旗舰Gemini 3.5 Pro缺席。
彼时,Gemini 3.6 Flash的表现被吐槽不如中国一线开源模型,但国内大模型厂商们却一同捕捉到Flash背后的产业信号,纷纷跟进布局这一效率架构路线。
十天后,国内大模型市场,DeepSeekV4 Flash正式版上线并开源,284B总参数、每次推理只激活13B。
DeepSeek还调整了卖模型的方式,涨价的同时,改成了峰谷分时的计费方式。
8月26日到28日这三天,Flash成了主战场。三天至少五款重量级模型落地,但Flash版本占到了多数。
智谱把匿名刷屏“牛来”(Ox-Alpha)认领为GLM-5.3-Flash,320B总参数,每次只激活18B;
阿里在同一天连夜放出Qwen3.8-Flash,总参数125B,每个token只唤醒6B参与计算。
1、腾讯发布了其最新一代旗舰模型预览版本
9月1日,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版模型。
上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模参数的模型。
但开源与低价的浪潮正在改写行业逻辑,过去Flash原本只是Google产品线上一个不起眼的档位,定位追求快、便宜、够用,如今新一代Flash已经进化为效率优先的架构版本,行业的比拼重心,也已经从 “谁的参数更大”,转向 “谁成本更低、更具备落地价值”。
如果只有三分之一的价格,已经能完成大部分日常任务,那你还会默认把所有工作交给最强模型吗?答案当然是否定的。
这也是2026年下半年,DeepSeek、智谱、阿里通义扎堆推出Flash等轻量模型的现实动因。
在此之前,市场认知里的Flash,只是旗舰模型的阉割减配版本。
厂商砍掉部分模型能力,换取更快的推理速度与更低调用成本,适合做简单对话,一旦遇到复杂推理、长链路任务,就会出现明显的能力断崖下滑。
Flash版本更多是作为旗舰产品的补充,承接边缘流量,很难走到业务舞台中央。
二、重点是架构层面的效率革新
1、重点是架构层面的效率革新
新一代Flash不是简单裁剪参数的减配思路,重点是架构层面的效率革新。
依靠MoE稀疏路由机制,模型保留庞大的总参规模与完整知识底座,每一轮推理仅激活一小部分参数参与运算。
真正把Flash推到主流位置的,是AI Agent规模化的兴起。
以阿里Qwen3.8Flash为例,模型发布的同时,千问办公Agent产品同步上线,模型与智能体业务的绑定趋势十分直观。
Agent的业务特性带来两层现实约束:一方面,大量工作集中在意图路由、信息抽取、工具调用等任务,并不需要旗舰模型顶尖的深度推理能力,但对推理延迟、并发承载力、调用成本高度敏感。
2、完成一整套Agent业务闭环
另一方面,完成一整套Agent业务闭环,往往需要数十次模型循环调用,倘若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化就无从谈起。
DeepSeek V4Flash、GLM5.3Flash、Qwen3.8Flash这类国产MoE模型,就是瞄准这类场景痛点打造的。
即便旗舰模型综合能力上限更高,但高昂的调用开销与更高时延,并不适配Agent高频次、大批量的运行需求。
海外独立评测社区Artificial Analysis曾实测上百款大模型,并据此画出一张性能与价格对比图。
DeepSeek-V4-Flash在这张图里成了一道醒目的“斩杀线”—— 意思是,在它的价格之下,性能比它差、价格还比它贵的模型,都不用看了。
DeepSeek过去半年的用户增长,很大一部分就是踩着这条 “斩杀线”走过来的。它不一定是同一时间段内最好的模型,但价格却足够便宜。
换句话说,现在各家推出的Flash所做的,就是在尽可能接近旗舰效果的前提下,把价格做到最低。
就在DeepSeek宣布涨价的节点上,低价价格带腾出了空间。
随后发布的GLM-5.3-Flash与Qwen3.8-Flash几乎同一时间把价格压到同一水位,新一轮“斩杀线”之争就此开场。
GLM-5.3-Flash与Qwen3.8-Flash价格几乎持平:输入0.8元、输出约2.7–2.8元/百万tokens,双双站上行业最低档。
三、进一步压低入场门槛
1、进一步压低入场门槛
智谱更是叠加限时5折(至9月9日),折后输入0.4元、输出1.4元,进一步压低入场门槛。
DeepSeek则坚持峰谷定价:高峰输入3.0元、输出9.0元,空闲时段半价。
平均下来约为另外两家的2–3倍,但视觉能力不额外加价,仍保留一张差异化底牌。
标价之下还有第二层。三款都支持上下文缓存,缓存命中的输入价会大幅下探,Qwen低至0.1元/百万tokens;
对系统提示长、上下文重复度高的场景,实际账单还能再砍一截。
而DeepSeek的缓存命中价在闲时只有0.05元,仍是三者最低。
便宜没有换来能力的缩水。
2、斩杀线的位置每隔几周就会往下挪一次
各家自测基准几乎不重合,目前最可比的第三方口径仍是Artificial Analysis智能指数:GLM-5.3-Flash拿到57分;
DeepSeek V4 Flash50分,也就是说智谱用比DeepSeek更低的价格,拿到了高出7分的第三方评分,这一次被斩的反而是当初立线的那个。
如今,斩杀线的位置每隔几周就会往下挪一次,而每挪一次,能活下来的模型就少一批。
上半年的叙事还是更多数据、更多参数、更多算力;
到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,把赌注压在“效率”两个字上。
当各家Flash的权重几乎全部开源、MoE“大总参、小激活”成为行业共识的基础架构,模型厂之间的区别,正在肉眼可见地变小。
算力这一侧,效率模型表面上是把成本打了下来,背后却有一场更烧钱的军备竞赛。
四、Flash恰恰是算力紧张时代的最优解
智谱动用10万张国产芯片集群支撑GLM-5.3-Flash的线上推理;
MiniMax称自己是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;
腾讯则罕见地公开承认“整体算力严重不足”,拖慢了混元迭代。
同一场竞争里,Flash恰恰是算力紧张时代的最优解:320B的GLM-5.3-Flash每次推理只唤醒18B,770B的Hy4只激活49B,同样的卡能服务更多用户、摊薄更多成本。
与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不去走效率路线。
数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。
DeepSeek靠强化学习与蒸馏,把推理能力压进13B激活的模型;Qwen在多模态语料配比上押注;
1、谁先跑通Agent的规模化闭环
智谱在数据与对齐工程上积累。
各家都在押注Agent,每一次Agent调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多Agent接入。
谁先跑通Agent的规模化闭环,谁就同时拿到了算力之外最深的护城河。
这也是千问的Flash发布就在千问办公Agent同步上线、模型与业务绑定如此紧密的原因。
在过去卷性能的时代,大家比的是榜单。但卷效率的时代,比的是工程化的能力还有价格。
如今价格战把模型压到成本线附近,模型层利润变薄,落到Agent、端侧与云服务身上的压力变得更重。
接下来模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。

远见网
