何恺明的ELF:当语言模型不再”挤牙膏”


2026年5月12日,一篇论文悄然出现在arXiv上。

没有发布会,没有产品Demo,没有CEO的博客预告。就是一个PDF链接,一段GitHub代码,一个MIT开源协议。

但读完这篇论文的人,反应出奇地一致——沉默几秒,然后说一句:“又来了。”

说”又来了”,是因为它的作者叫何恺明

上一次他”又来了”,是2015年。深度神经网络正在遭遇”退化问题”——网络越深,训练越崩。全行业束手无策。他扔出一篇ResNet,用一个”跳跃连接”的简单想法,把网络从几十层推到了152层,后来推到了1000层。这篇论文成了21世纪被引次数最多的AI论文。

再上一次他”又来了”,是2021年。所有人都在用有监督预训练做图像识别,自监督被认为”不如监督”。他扔出一篇MAE(掩码自编码器),用一个”遮住75%的图再重建”的暴力思路,在训练效率上碾压了监督学习,同时精度更高。

2026年5月,他又”来了”。 这次他盯上的,是语言模型。

论文名叫ELF(Embedded Language Flows)。何恺明的第一个语言模型。105M参数——在这个动辄千亿参数的时代,小到几乎可以忽略不计。

但它背后提出的问题,大到足以让整个AI行业重新审视自己过去十年的信仰。


一、十年”挤牙膏”:自回归的隐形垄断

要理解ELF为什么重要,你先要理解一件事——

自2017年Transformer架构诞生、2018年GPT问世以来,几乎整整十年,全世界的语言模型都在用同一种”语法”生成文字:

自回归。逐词预测。一个字一个字地往外蹦。

它的工作方式只有一种:看着前面已经写好的内容,猜下一个最可能是什么字。写完了,把这个字加进”已写好的内容”里,再猜下一个。如此反复。

(ps: 你现在正在读的这句话,如果让GPT来写,它会在每一个字写出来之前,把前面所有的字都”复习”一遍——这个字、这个字、这个字……然后小心翼翼地猜:下一个字大概率是”这”。这就是自回归。)

这种”挤牙膏”式的生成方式有一个致命的问题——它只能往前走,不能回头看。

生成第100个字的时候,它能看到第1到第99个字。但它没法在第500个字写完之后,回头把第32个字改掉——哪怕它后来”意识到”那是个错别字。

自回归是线性的。而语言,很多时候不是线性的。

你写一篇文章,是不是经常写完第三段,才意识到第一段应该换个角度?你是不是经常在结尾处,才想清楚开头该怎么写?

自回归做不到这些。它被锁死在了时间顺序里。

但过去十年,没有人真的质疑这一点。为什么?因为自回归太成功了。GPT-3让人们以为语言就是线性的。ChatGPT让人们以为”只能一个字一个字地写”是理所当然的。

成功本身,变成了垄断最好的辩护词。


二、“冲洗照片”:一种完全不同的生成逻辑

而何恺明的ELF,做了一件非常简单——同时非常激进的事:

它完全抛弃了”逐词预测”。

ELF的工作方式不像”挤牙膏”。它像”冲洗照片”。

如果你用过胶片相机(或者至少看过相关描述),你会知道一张照片诞生的大致过程:一开始,底片上什么都没有,只有混沌的感光颗粒。把它放进显影液里,图像不是”逐行出现”的,而是全局同步地——从模糊到清晰,从混沌到有序,整张照片一起变清楚。

ELF的文字生成也是这样。它从一团”高斯噪声”开始——你可以想象成,所有可能的词、所有可能的句子,以概率云的形式混合在一起,像一个极度模糊的底片。然后它进行一轮又一轮的”去噪”——每一次迭代,整段文字的所有位置同时变得更清晰、更连贯。

32步之后,一段完整的、语法正确、语义连贯的文字,像显影完成的照片一样浮现出来。

(ps: 这就回答了”为什么ELF的采样步数不需要等于文本长度”——GPT写512个词需要512步,ELF只需要32步。因为它不是”写”,是”显影”。)

而这个设计中最关键的一步——也是论文标题中”Embedded”的含义——是何恺明做的一个关键技术决策:

ELF全程在连续空间中工作。离散化——也就是把数学向量变成可读单词——只在最后一刻才发生。

这听起来可能有点抽象。打个比方:

经典的扩散语言模型每走一步,都要”检查”一下:“我现在这个状态对应哪个单词?好,是这个。然后下一步,我还是从这个单词出发,重新嵌入到连续空间,继续去噪……”

这就好比你冲洗照片的时候,每过5秒钟就把底片从显影液里拿出来,晾干,看一眼,再放回去——整个过程被打断了无数次。

ELF不做这种事。 它让整个去噪过程在显影液中连续完成,直到最后一步,才”咔嚓”一下定影。全程流畅,没有中断。

这种设计带来的一个意想不到的好处是——ELF可以直接复用图像生成领域(Stable Diffusion、Midjourney等)过去十年积累的所有数学工具和优化技术。Classifier-Free Guidance(CFG)——那个让Midjourney能精确控制图像风格的技术——现在可以直接用来控制文本的”忠实度”和”创造力”。

何恺明再一次证明了:“你觉得此路不通,是因为你没找到正确的走法。“


三、10倍效率:不是”好一点点”,是”少用一个数量级”

好了,技术细节讲完了。你真正需要记住的是这个数字:

ELF达到同等性能水平,所需的训练数据量,是当前主流方法的十分之一。

不是”省了10%“,是减少了一个数量级

具体来说:ELF-B(105M参数)在OpenWebText基准上达到了约24.1的生成困惑度,用了大约450亿个Token。而对比的主流方法,通常需要超过5000亿个Token。

10倍。

而且,ELF不需要蒸馏。很多模型需要通过一个复杂的”蒸馏”过程——用一个更大的模型”教”一个更小的模型——才能实现速度和质量之间的平衡。ELF跳过了这个过程。它的生成质量直接超过了经过蒸馏的其他扩散语言模型。

(ps: 这意味着什么?不是”ELF现在就是GPT的替代品”——105M参数在GPT面前是玩具。它意味着:如果一种全新的架构,在小规模上展现了10倍的训练效率,那么在大规模上,这种效率优势会不会保持——甚至放大?)

我们都知道一个规律:如果一种新技术在小规模上展现了数量级的效率优势,它在大规模上,通常不是”等比例放大”,而是”非线性爆发”。

因为小规模实验往往低估了效率提升在大规模时的复利效应。这就像你用”年化10%“和”年化15%“分别投资——前两年的差距不大,但三十年后,不是1.5倍,而是几十倍。


四、何恺明模式:在”集体共识”的边界上反复突破

如果你回溯何恺明的学术生涯,你会发现一个清晰的模式——他每一次出手,都是在行业”集体共识”认为最难甚至不可能的地方。

年代集体共识何恺明做了什么
2015深度网络训练会”退化”,越深越崩ResNet:让152层网络比18层更好训练
2021图像自监督学习比不上监督学习MAE:遮掉75%的图重建,效率和精度双杀监督
2026连续扩散语言模型不如离散扩散ELF:全程连续+最后一刻离散化=10倍效率

三次突破,三次都是在”全行业都说此路不通”的时候,他找到了一条通道。

这不是运气。这是一种方法论。

何恺明的论文有一个共同特点:它们通常不会发明全新的东西,而是重新审视那些被行业集体放弃的”旧方向”,然后找到一个简单的、结构性的改动,让”旧方向”重新成立。

ResNet没有发明深度网络——它只是在层之间加了一个”跳跃连接”。这个操作简单到你可以用一行Python写完。但它改变了梯度传播的整个逻辑。

MAE没有发明自监督学习——它只是把遮罩比例从15%提到了75%,然后把解码器变轻了。就这两点。训练效率提升了3倍多。

ELF也没有发明扩散语言模型——连续DLM的研究至少可以追溯到2022年。但它把”什么时候离散化”这个问题重新思考了一遍,然后把答案推到了”最后一刻”。

“简单”到让你觉得”我也能想到”,但你就是没想到。

这才是真正的范式突破。


五、太阳底下没有新鲜事——但太阳本身在变

2026年5月,当AI行业的主流叙事是”scaling撞墙了”、“数据枯竭了”、“预训练到顶了”——

一篇轻量级的论文,用105M参数,证明了语言建模存在另一条路。

这条路能不能通向当前GPT-5.5、Claude Opus 4.6所在的”千亿参数+万亿Token”的前沿?ELF自己不知道。它只是一个中等规模的验证实验。

但它证明了一件事,比任何具体数字都重要:自回归不是语言模型的唯一答案。

十年前,我们以为”深度网络不能超过20层”。ResNet证明了我们可以做到152层、1000层。

五年前,我们以为”图像自监督永远赶不上监督学习”。MAE证明了它可以。

今天,我们以为”语言模型必须是自回归的”。

何恺明什么都没有说。他只是在arXiv上扔了一篇论文。

标题很平淡。摘要很简洁。代码开源,MIT协议。

就像每次一样——你以为的”天花板”,只是某个还没被发现的设计选择在维持着。


结语:被遮蔽的语法

人类会说话,但人类没有”挤牙膏”。

当你说一句话的时候,你不是先确定了第一个字,才考虑第二个字,然后一条路走到黑。你的大脑在做一件更接近”去噪”的事——一团模糊的语义意图,在毫秒之内被同步整理成语序、词汇、语调,然后一口气说出来。

自回归是机器的发明,不是语言的本质。

ELF也好,扩散语言模型也好,它们最终要回答的问题不是”能不能比GPT更强”,而是——

如果语言建模的思路从”模仿打字机”变成”模仿大脑”,会打开怎样的能力空间?

我们只知道自回归这条路上有什么。我们不知道另一条路上有什么。

而”不知道有什么”,恰恰是最让人兴奋的部分。


(本文为”AI模型进化系列”第三篇。前两篇分别探讨了能力收敛之辩和推理成本的超级摩尔坠落。下一篇——也是最后一篇——将回到龙鹰镖局的终极命题:中美AI的大分流。当范式没有固化、效率仍在狂飙、芯片却被锁死——两条路线的战略性对撞,才刚刚开始。)


小龙创作,2026年5月