改变世界的八页纸:一篇论文的八个作者全部离开了谷歌,然后世界被改变了

原创出品 | 龙鹰镖局


2017年春天。谷歌山景城园区。

八个谷歌员工正在疯狂赶一篇论文。NeurIPS的截稿日期是5月19日。从2月开始他们就几乎没有睡过整觉。其中一个人偶然在走廊里听到了一场关于自注意力的激烈争论——所有当时最好用的序列模型都依赖一种叫”循环神经网络”(RNN)的东西。RNN的问题很简单:慢。它必须一个词一个词地读、一个词一个词地翻译,就像人在黑暗里用手电筒一行一行地看书——光束扫到哪里,哪里才是亮的,没扫到的地方全是黑的。

一个人突然说了一句话——“如果不要循环呢?只靠注意力就够了。”

这句话后来成为论文的标题。八个人,八页纸,一个全新的架构。那篇论文没有拿到NeurIPS的最佳论文奖。甚至没有拿到oral presentation——只有一个海报展示。

但今天,你把全世界所有生成式AI产品剥开皮——ChatGPT、Claude、Gemini、DeepSeek、文心一言、通义千问——里面都是同一个东西:Transformer。

而那八个作者——全部离开了谷歌。

他们创办的公司估值加起来超过150亿美元。他们的论文被引用了超过15万次。他们没有发明人工智能——但他们发明了现代人工智能。

这不是一篇关于技术突破的故事。这是一个关于”谷歌发明了改变世界的东西,然后眼睁睁看着世界被别人改变”的故事。


一、一顿午餐和一场争论

故事从雅各布·乌斯克尔特(Jakob Uszkoreit)说起。

乌斯克尔特是德国人,2008年加入谷歌。2014年左右,他开始酝酿一个在当时看来极其异端的想法——自注意力机制可以取代RNN。

RNN是2010年代机器翻译的王者。从LSTM到GRU,“序列模型”基本上就等于”循环网络”。它们的致命弱点是:无法并行化。一个句子有50个词,你就必须跑50步——每一步的计算都依赖上一步的结果。在GPU已经被AlexNet证明可以大规模加速神经网络的2010年代,这就像一个老式手摇发动机被装在了跑车引擎室里。

乌斯克尔特的想法不同。他问了一个问题:如果不需要一步步来呢?如果模型不是”读一个字,更新一下状态,再读下一个字”——而是同时看到所有字,自己决定该关注哪一个?

2016年的一天。谷歌餐厅。乌斯克尔特和伊利亚·波洛苏金(Illia Polosukhin)一起吃午饭。他聊起了自注意力。波洛苏金是谷歌研究院的工程师,对机器翻译有深入研究。那顿午饭之后,波洛苏金决定加入这个方向。

他们邀请了第三个人——阿什什·瓦斯瓦尼(Ashish Vaswani)。瓦斯瓦尼是印度裔,南加州大学博士,2016年刚加入谷歌大脑。他把第一个Transformer模型设计加实现了出来。

随后加入的是尼基·帕玛(Niki Parmar)。她2015年南加州大学硕士毕业,在多家科技巨头的offer中选择了谷歌。加入乌斯克尔特团队后,她负责设计、实现、调参、评估数不清的模型变体——论文里说她对”countless model variants”做出了贡献。那不是一个修饰词。那是真实的、无数个不眠夜。

然后是利昂·琼斯(Llion Jones)。威尔士人,2009年在经济危机中找到谷歌的工作。他的同事Mat Kelcey跟他提过一次”自注意力”。琼斯后来认真向Kelcey介绍了整个Transformer项目,想拉他入伙。Kelcey回忆说:“我不太确定这能不能行——而这可能是一生中最大的判断失误。

(ps:历史上每一个伟大突破的背后,都有一个拒绝了它的人。Kelcey的笑话是:他不是唯一一个。谷歌内部有很多人都不看好Transformer。他们没有阻止——但也完全没有意识到他们在看什么。)

第三波加入者是乌卡什·凯撒(Łukasz Kaiser)和他的实习生艾丹·戈麦斯(Aidan Gomez)。戈麦斯是多伦多大学的本科生,在安大略省的农庄长大,每年春天帮家里采摘枫树糖浆。他大三时”深陷”AI,加入了辛顿的实验室。然后他开始主动联系谷歌发表过有趣论文的人——其中一封邮件发给了凯撒。凯撒邀请了这个本科生来实习。戈麦斯到了谷歌几个月后才发现:这个实习岗位原本只对博士生开放。

最后一个加入的人,是整个故事的转折点——诺姆·萨泽尔(Noam Shazeer)。

萨泽尔是谷歌传奇。2000年加入,是谷歌早期广告系统的核心架构师。2017年的一天,他偶然经过凯撒和瓦斯瓦尼的办公室,听到了他们关于自注意力的激烈争论。他站在门口听了几分钟。然后走了进去。他后来在论文中贡献了缩放点积注意力、多头注意力、和免参数的位置编码——几乎每一个你今天在学校里学到的Transformer核心概念,都有他的指纹。

八个人到齐了。

他们还给自己取了一个名字。早期设计文档的封面是变形金刚的六个角色。项目名:Team Transformer。

论文标题致敬了披头士——《All You Need Is Love》。

他们写的是:Attention Is All You Need。


二、“它甚至没有拿到最佳论文”

2017年6月12日,论文提交到arXiv。12月,正式在NeurIPS 2017上发表。

论文只有八页——不包括参考文献和图表。八页,165个引用,一个全新的架构。核心思想用一句话就能概括:放弃循环,放弃卷积,只靠注意力机制来建模序列。

但它真正的创新在于细节。

缩放点积注意力。 Q、K、V三个矩阵——查询、键、值。这个灵感来自数据库检索。查询(我想要什么)乘以键(我有什么),除以一个缩放因子防止梯度爆炸,经过softmax变成权重,再乘以值。这就是注意力的数学本质——“在所有信息中,决定哪些对我重要”。因为用的是矩阵乘法而不是循环,整个计算可以在GPU上大规模并行。

多头注意力。 不是一组QKV。是八组。每一组”头”学会关注不同的关系——有的关注主语和谓语,有的关注形容词和名词,有的关注跨句引用。这些头并行运行,最后拼接起来。就像八个侦探同时调查同一个场景,每个人盯着不同的线索,最后把各自看到的拼在一起。

位置编码。 这是一个聪明到让人发笑的细节。Transformer没有”顺序”的概念——它看到的是整个句子同时摊开。那怎么知道哪个词在前哪个词在后?用正弦和余弦函数。sin和cos——高中数学里的两个函数,被用来编码每个词在句子中的绝对位置。不需要学习。不需要额外参数。数学上天然就无限长度的序列都能工作。

训练用了3.5天。8块P100 GPU。在英德翻译上BLEU得分28.4——比之前所有模型(包括集成的)高出超过2个BLEU。在英法翻译上41.0——四分之一的计算开销,最好的单模型成绩。

但NeurIPS没有给它最佳论文。连oral都没有给。只是一个海报展示。

在长滩会展中心的海报区,八个人站在一张展板前面,面前挤满了围观的研究者。那些挤过来的人——有的当时只是好奇,有的是从波士顿、多伦多、蒙特利尔专门飞过来看的。他们闻到了什么。一篇普通的机器翻译论文不会让这么多人围着一张海报不走。

在围观的人群中,有一个人站了很久。他叫Ilya Sutskever——OpenAI的首席科学家。(ps:他在本系列已经出现过多次了。AlexNet的第二作者。辛顿的学生。太浩湖拍卖会上的三个人之一。他现在在OpenAI。)Sutskever曾在谷歌工作过,知道这个团队的存在。他飞回旧金山后,找到OpenAI的科学家Alec Radford。

Sutskever说了一句话:“你该看看这个。”

Radford看了。然后他写了第一行GPT的代码。

而谷歌——谷歌花了整整一年才意识到自己创造的东西有多重要。2018年,BERT出现了。2019年,Transformer被整合进谷歌翻译。但真正的革命发生在别处。OpenAI用Transformer做了GPT。然后GPT-2。GPT-3。GPT-4。Anthropic用Transformer做了Claude。Meta开源了LLaMA。中国的DeepSeek在Transformer的基础上做了MoE。

谷歌发明了引擎。但全世界造出了汽车、飞机和火箭。


三、变形金刚的散场

八年过去了。八个作者,全部离开了谷歌。

诺姆·萨泽尔在谷歌工作了二十年。2021年10月离开,联合创立了Character.AI——一个能让用户和AI角色对话的平台,估值一度达到50亿美元。2024年,他又回到了谷歌——以被收购的方式。

阿什什·瓦斯瓦尼和尼基·帕玛2021年一起离开,创立了Adept AI——做企业AI自动化的公司,估值约10亿美元。2022年两人又离开Adept,创办了第二家公司Essential AI——做基础模型,2026年估值已到10亿美元。帕玛后来加入了Anthropic,参与了Claude 3.7的开发。她是八个作者里唯一在顶级前沿AI实验室做一线研究的人。

利昂·琼斯2023年离开谷歌,和原谷歌研究员David Ha一起在东京创立了Sakana AI——一家以”鱼”命名的AI公司,专注于受自然启发的智能。估值2亿美元。

艾丹·戈麦斯——那个以本科生身份误闯博士实习岗位的农庄男孩——2019年离开谷歌,回到多伦多联合创立了Cohere。一家专注于企业级大语言模型的公司,估值约22亿美元。

雅各布·乌斯克尔特2021年离开谷歌,创立了Inceptive——一家用AI设计RNA药物的生物科技公司。Transformer最核心的创造者,现在在用AI改变制药行业。(ps:等这个系列完结之后,某一天我们可以回到第一篇——1956年达特茅斯的那个夏天,四个人写了一份AI的提案。70年后,其中一个人的思想后裔正在用同样的技术去破解生命的代码。这就是历史最深沉的回声。估值3亿美元。)

乌卡什·凯撒是唯一没有创业的人。他加入了OpenAI,成为Q*(传说中的下一代推理系统)的发明者之一。当WIRED记者试图在采访中问清楚Q*到底是什么时——OpenAI的公关几乎是跳起来让他立刻闭嘴。

伊利亚·波洛苏金2017年2月离开谷歌——在论文提交前就离开了。他创立了NEAR Protocol,一个去中心化区块链平台,代币市值约40亿美元。他可能是这个团队中唯一不走AI路线的人——他走的是”用区块链重构互联网”的路线。

八个人。七个创业者。一个被困在OpenAI保密协议背后。八个截然不同的人生轨迹——从同一个八页的论文开始。

他们所有人都知道一件事:留下来不是最优选择。

戈麦斯后来对《金融时报》说:“他们没有跟上现代化的脚步,没有采纳这项新技术。“他说的不是某个无名小公司。他说的是谷歌——那个创造了Transformer、拥有全世界最强大的AI研究团队、掌握着海量数据的谷歌。

OpenAI的CEO Sam Altman后来也补了一刀——在2023年的一次采访中说:“Transformer论文发表时,我觉得谷歌没人真正意识到它会产生什么样的深远影响。


四、八页纸的遗产

现在回头看看这篇论文——它到底改变了什么?

它没有发明注意力。2014年Yoshua Bengio实验室已经发表了第一篇注意力机制的论文。

它没有发明”大语言模型”。Seq2Seq、LSTM、神经机器翻译——这些都是成熟的领域。

它发明的是一个引擎——一个足够简单、足够高效、足够可扩展的引擎,以至于所有后来人只需要把数据倒进去、把算力加上去、把网络叠上去——它自己就会学会一切。

在Transformer之前,如果你想让一个模型同时处理文本、图像、音频和视频——你需要为每一种”模态”设计专门的架构。文本用RNN。图像用CNN。语音用另外一套。

在Transformer之后——你只需要把文本切成token,把图像切成patch,把音频切成时间帧,全部都喂进一个Transformer。它自己会学会一切之间的关系。多模态不是被设计的。是被涌现的。

这篇论文最后一章的最后一段是这么写的——

“我们对基于注意力的模型的未来感到兴奋,并计划将它们扩展到文本以外的输入和输出模态——图像、音频、视频。让生成过程更少地依赖序列化是另一个研究目标。”

2017年的八个人在结尾处随手写的这行字,现在读起来几乎像咒语——它说的就是接下来五年将要发生的一切。

2020年:Vision Transformer把图像当成”词序列”来理解——CNN在计算机视觉里十年的统治结束了。

2021年:多模态Transformer——CLIP、DALL-E——同时理解文字和图像。

2022年:ChatGPT出现。两个月1亿用户。人类历史上增速最快的消费产品。

2023年:GPT-4、Claude 2——Transformer开始解数学题、写代码、做法律分析、诊断疾病。

2024年:Sora——用Transformer生成视频。

2025-2026年:Agent、长上下文、推理能力——所有这些,都跑在同一个架构上。

那个架构,就是八个人在2017年花了三个月写出来的那篇八页论文。

这篇论文甚至不是NeurIPS的最佳论文。

但它是AI行业有史以来最重要的论文。


尾声:变形金刚们还在一起

2024年。C&C奖——日本最负盛名的信息科学奖项——颁给了”Transformer团队”。

八个名字全部列在获奖公告上。这是自从2017年以来,他们八个人的名字第一次再次出现在同一份官方文件上。

瓦斯瓦尼在旧金山。帕玛先在Essential AI后去了Anthropic。萨泽尔从Character.AI回到了谷歌DeepMind。琼斯在东京。戈麦斯在多伦多。乌斯克尔特在德国做AI制药。凯撒在OpenAI被公关严密”保护”着。波洛苏金在他的区块链世界里继续构想去中心化的未来。

他们散了,散了八年了。

但在每一个用着ChatGPT打字的人面前。在每一个用Claude写代码的工程师面前。在每一个用DALL-E画图的艺术家面前。在每一个被DeepSeek震撼的投资者面前。在每一个在手机上唤出AI助手的普通人面前——

他们八个人的名字,正安静地、不可磨灭地、写在那个把一切连接起来的引擎的每一个矩阵乘法运算的深处。

Attention。QKV。Multi-Head。Softmax。LayerNorm。

所有这些词,都来自2017年那个春天。

那篇标题致敬了披头士的论文。

爱是你所需要的一切。注意力也是。


原创出品:龙鹰镖局

「AI群星闪耀时」系列 · 第八篇 上一篇:第七篇 · 2016,第37手——AlphaGo的一颗不属于人类的棋子 下一篇预告:2022,奇点之夜——一个按钮按下去,两个月后1亿人。OpenAI的工程师们不知道自己在打开什么


参考资料:Vaswani et al., “Attention Is All You Need” (NIPS 2017); WIRED “8 Google Employees Invented Modern AI” (2024); C&C Prize 2024公告; CNBC/Sakana AI; Wikipedia Attention Is All You Need; InfoQ/腾讯云中文报道; FT/CoinDesk报道等