不蒸馏,大模型公司的代价是什么?

一、一个正常的训练管线

“一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决后面的的那10分。

”谈及蒸馏在当前LLM(大语言模型)训练的作用,一位基模研究员这样说道。

他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,尽快得到一个可以继续训练的基础版本。

对模型公司而言,“不蒸馏”则意味着要放弃这段加速过程,从基础能力开始自行探索。

这样做的好处是,可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。

《智能涌现》此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。

一名字节人士解释,团队希望进入全球第一梯队,而这“通过蒸馏难以达到”。

张一鸣在7月底一次Seed内部会议上也明确表示,即使暂时落后于国内同行,字节也不会把蒸馏当作提升模型能力的捷径。

这一番关于“不蒸馏”的表态,不只是一个训练方法上的技术判断,而是对长期路线的选择。

另一方面,在张一鸣表态“不蒸馏”的前一周,英伟达CEO黄仁勋在接受Axios联合创始人迈克·艾伦采访时曾表达过完全相反的观点:“蒸馏,也就是向AI学习、向其他知识来源学习,是智能的基础。

在这场采访结束几天后,黄仁勋转发了一封由英伟达、Meta、微软和戴尔等公司支持的开放模型联名信。

信中主张建立能够进入各行各业的开放模型生态,并将蒸馏列为模型改进、测试和验证中广泛使用的方法。

到底该不该蒸馏?不蒸馏的代价和回报分别是什么?《智能涌现》跟多位大模型研究员交流了相关问题。

1、不蒸馏,要付出多少时间

在他看来,国内预训练与北美前沿仍有差距,但已不像早期那样悬殊,而更大的差距发生在后训练和高质量数据层面。

选择不蒸馏的字节,不需要面对这些问题吗?实际上并不是。

二、多位研究员都认为

1、多位研究员都认为

7月底,字节的最新一代基模Seed-2.1 Pro在Code Arena WebDev总榜列第16,落后于第2的Kimi K3和第6的GLM-5.2。

模型能力提升的时间压力来自数据飞轮。模型先达到可用水平,才会进入真实开发环境。能力带来使用,使用产生回流数据,回流数据又进入下一轮训练。

此前,一名字节人士曾告诉《智能涌现》,其Coding模型此前难以突破的原因之一,正是业务使用意愿不足、缺少足够的数据回流。

Agent任务进一步放大了这种时间差。

当前Agent场景中,多轮工具调用需要模型连续规划、执行和纠错,前序步骤一旦偏离,错误可能沿着任务链不断累积。

模型从头探索一条成功轨迹,通常比直接学习已经跑通的过程更慢。

2、字节在视频生成领域已经进入全球前列

一位接近字节的人士向《智能涌现》表示,Seedance的视频训练链路不使用外部模型蒸馏,连用于数据筛选、理解等环节的VLM,也不以其他模型的输出作为蒸馏来源。

在视频生成赛道,字节凭借数据、架构和产品积累,已经在不借助外部模型蒸馏的情况下进入前沿;

在Coding和Agent赛道,它仍需尽快补齐能力差距,获得更多真实使用和回流数据。

在LLM领域,当其他大模型公司借助蒸馏完成冷启动、提前进入真实场景时,坚持不蒸馏的字节要用更长的训练周期,验证这套自建数据体系能否转化为领先能力。

3、蒸馏的回报和代价

现代知识蒸馏的经典范式,可以追溯到图灵奖得主、深度学习先驱辛顿等人在2015年发表的《神经网络中的知识蒸馏》。

例如,2019年发布的DistilBERT将BERT缩小40%,保留97%的语言理解能力,并把推理速度提高60%。

当时,蒸馏主要解决模型太大、部署太贵的问题。

生成式AI兴起后,更强模型生成的答案、解释和任务轨迹,也开始被直接用于训练其他模型。

2023年3月,斯坦福团队用OpenAI模型生成5.2万条指令数据,以不到500美元的数据成本训练Alpaca;

同年,微软让130亿参数的Orca学习GPT-4给出的解释轨迹,在Big-Bench Hard复杂零样本推理上达到与ChatGPT相当的水平。

2024年发布Llama 3.1 405B时,Meta CEO扎克伯格就已将蒸馏小模型列为开放旗舰模型的重要用途;

Meta同期还把合成数据生成写进了该模型的主要工作流。

到2026年,蒸馏已经成熟应用在模型能力合并上。

DeepSeek V4技术报告披露,团队先以监督微调和强化学习分别训练十多个数学、Coding和Agent等领域专家,再让通用模型在自己采样的轨迹上,学习各个专家的输出分布,以多教师在线策略蒸馏合并能力。

Kimi K3也把蒸馏放进后训练主流程。

其技术报告显示,团队围绕通用推理、Coding和Agent任务,以及low、high、max三档思考强度,形成9个教师模型,再通过多教师在线策略蒸馏整合到同一个模型中。

“归根结底,蒸馏是一种构造数据的方法。

三、韩国科学技术院研究团队提交的一项研究显示

这种回报在Agent训练中尤其直接。

上周,韩国科学技术院研究团队提交的一项研究显示,从GPT-5-mini的成功轨迹中提取任务流程、子任务示例和工具调用经验,在三项工具使用基准中均提升了4B至8B模型的任务准确率。

如果只训练一个学生,还要为此从头训练教师,直接训练往往更划算。

蒸馏节省了寻找答案的时间,却不能替模型公司决定应该解决什么问题。

“蒸馏说白了并不复杂,一道题让更强的模型跑一遍,再把轨迹拿出来改成训练格式。

蒸馏的回报是时间和算力,但这种效率也有代价。不少研究员向《智能涌现》表示,蒸馏通常用于把模型尽快推过可用门槛;

此外,蒸馏也会改变一家公司的资源分配。

几周前,在Kimi K3发布后,劳德研究所研究者、Snorkel AI联合创始人布雷登·汉考克表示,仅靠蒸馏,不可能在如此短的时间里训练出这种强度的模型。

艾伦人工智能研究所研究员内森·兰伯特也指出,如果蒸馏足以复制前沿能力,其他团队本应很容易追上GLM或Kimi,但现实并非如此。

围绕蒸馏,这场长期主义和时间成本的博弈还在继续,在资源和团队技术路线的比拼之外,也考验着行业等待结果的耐心。

来源: 投资界-首发
产业标签 AI中国/大模型与AI Agent
赞(2) 支持本站
分享到

支持本站持续更新

如果这篇内容对你有帮助,欢迎扫码支持。

支付宝扫一扫

微信扫一扫

登录

找回密码

注册