AI的数学血脉|在4096维空间里寻找意义
我们走了十四篇。
两千五百年。从欧几里得的五条公设,到GPT-5的万亿参数。二十多个数学家的人生——谷神星轨道、马车踏板、皇家学会的阴谋、贝尔实验室的下午茶、被当废纸的600本书、黑咖啡之夜、一列在1913年的圣彼得堡被手工计数的俄语字母。
这一个系列追问了同一个问题,换了十五种问法:
人类是如何建造出可以理解意义的机器的?
最终的答案——不在任何一个单独的算法或架构里。它藏在一条跨越千年的因果链中。这条链上的每一个节点,都是一个被某人发现的数学真理。当他们写下那些公式时,他们不知道这些公式会在几百年后被用来做什么。
高斯不知道他的消元法最终会在H100芯片上以每秒万亿次的速度执行。莱布尼茨不知道他的dy/dx会成为每个AI模型训练循环中最底层的一行代码。香农不知道他定义的交叉熵会成为地球上最昂贵计算的唯一”计分板”。他们只是——发现了一些东西。这些东西是真的。它们等待了足够长的时间——等到了人类有足够的计算能力来使用它们。
现在是2026年。当我们把这些数学血脉汇聚到一起,它们在做什么?
一、当我们说”理解”,我们在说什么
你打开ChatGPT。你输入:“用莎士比亚的风格写一首关于AI的诗。”
在你按下回车的那一刻——在你甚至没看到输出之前——幕后的计算已经开始了。
第一步。Token化。你的句子被切碎成最小单元。“用/莎士比亚/的/风格/写/一首/关于/AI/的/诗”。
第二步。嵌入(Embedding)。每一个Token被映射为一个向量——GPT-3中是12288维。每个Token不再是一个字,而是高维空间中的一个点。 这是格拉斯曼的遗产。1844年。他说空间可以是任意维度的。180年后,维数变成了12288。
第三步。位置编码。纯粹的向量没有顺序——“狗咬人”和”人咬狗”是完全不同的两句话。位置编码给每个向量注入它在序列中的位置信息。
第四步。通过注意力层(Attention)。每一个Token的向量——“看”到序列中所有其他Token的向量。计算它们之间的相似度(点积)。决定哪些Token与当前Token最相关。这是矩阵乘法——凯莱1858年定义的运算。被V100/H100的Tensor Core并行执行。在高维特征空间——希尔伯特1904年的遗产——中运行。
第五步。通过前馈网络(FFN)。两个巨大的矩阵乘法——先膨胀到4倍维度,再压缩回来。对注意力输出做非线性语义提纯。
第六步。残差连接和层归一化。100层。重复第四步到第六步。100次。
第七步。最后一层的输出通过Softmax函数,转化成下一个Token的概率分布。这是贝叶斯定理1763年的遗产。P(下一个词|所有上文)。这是马尔可夫链1913年的遗产。给定当前状态,预测下一个状态——只不过”当前状态”是你整段对话的完整语义表征。
第八步。采样。从概率分布中随机选择下一个Token。
第九步。回到第二步。新Token加入序列。整个过程再次运行。直到输出结束符。
(ps:这九步写了人类数学史上最重要的九个思想。没有一个是AI研究者”发明”的。他们只是——挑选了最适合的数学工具。高斯、凯莱、傅里叶、格拉斯曼、莱布尼茨、牛顿、贝叶斯、马尔可夫、柯尔莫哥洛夫、香农、黎曼、庞加莱。这个名单上的每一个人,都不知道他发明的工具将被用来建造一个能理解人类语言的机器。)
二、语义是一种几何
2013年。Word2Vec。
vec(“King”) - vec(“Man”) + vec(“Woman”) ≈ vec(“Queen”)。
NLP学界被震惊了——不是因为它是错的,而是因为它是对的。
一个模型,从未被告诉过”国王”和”女王”之间的关系是”性别”。从未被标注过”巴黎是法国的首都”。它只是阅读了大量的文本——看一个词和哪些词一起出现——然后语义就被编码成了几何关系。
国王是一个点。王后是另一个点。它们之间的向量差——“国王减男人”——指向了一个方向。那个方向的名字叫”王权”。
加上”女人”——沿着”性别”方向移动——你到达了”王后”。
(ps:这个发现不是工程突破。它是哲学突破。它证明了一个两千年来无法被证明的猜想:意义有几何结构。 柏拉图认为”理念”存在于一个超越物质世界的完美领域。中世纪的经院哲学家争论”共相”是否是真实存在的。索绪尔认为”能指”和”所指”之间的联系是任意的。Word2Vec给出了一个前无古人的答案:意义确实存在——在数学空间中。 它不是物理的。但它和物理一样真实。它可以被测量(余弦距离)。可以被操作(向量加法)。可以被数学定理描述。正如黎曼1854年说的:空间的性质不是从外部赋予的,是从内部生长出来的。语义空间——也正是如此。)
三、整个旅程的地图
第一篇:高斯用消元法算谷神星轨道。凯莱发明矩阵。无人阅读的论文变成了世界上最重要的计算。
第二篇:傅里叶拆开热方程,发现特征函数。一百年后,希尔伯特和冯·诺依曼把它变成谱理论。又一百年后,LoRA用它把万亿参数压缩到r=2。
第三篇:格拉斯曼自费出版了一本书。600本被当废纸。180年后,GPT在4096维空间里理解语言。
第四篇:牛顿和莱布尼茨独立发明了微积分。两个天才花了整个余生互相仇恨。莱布尼茨死时葬礼空无一人,但他的dy/dx活在所有AI论文里。
第五篇:链式法则——微积分中最不起眼的规则。三百年后被反向传播算法唤醒,变成了地球最重要计算的基础操作。
第六篇:柯西发明梯度下降——三页纸。他觉得不重要。179年后,AdamW用同样的思想引导万亿参数”下山”。
第七篇:贝叶斯——一个英国牧师的遗稿。差点被遗忘。今天,ChatGPT选择每一个词时,都在计算条件概率。
第八篇:马尔可夫手数了两万个俄语字母。发明了历史上第一个NLP实验。他的链现在统治了搜索引擎和语言模型。
第九篇:柯尔莫哥洛夫用60页小册子公理化概率。三条公理。所有的AI概率建模都在上面运行。
第十篇:熵——从蒸汽机到分子到电话线到ChatGPT。一个概念跑了180年,变成了AI训练唯一的损失函数。
第十一篇:1943年贝尔实验室的下午茶。香农和图灵讨论”机器能否思考”。维纳在旁边写《控制论》。三条思想河流汇成了AI。
第十二篇:两个密码学家定义了一个不对称的”距离”。它的不对称——不是bug——是feature。七十年后,KL散度守护模型在变好时不忘本。
第十三篇:欧几里得的五条公设统治了两千年。罗巴切夫斯基和鲍耶挑战了它。黎曼重新定义了”空间”。爱因斯坦在黎曼的流形上建造了引力。AI在黎曼的流形上理解语义。
第十四篇:庞加莱一只脚踏上马车。灵光闪念:Fuchs函数=非欧几何。他创立了拓扑学。高维空间的恐惧:球的体积趋于零、所有距离都一样、直觉完全失效。
四、世界上最昂贵的数学魔术
现在我们站在终点回望。
到底什么是大语言模型?
它是五个数学分支——线性代数、微积分、概率论、信息论、高维几何——在一个人工建造的巨型计算系统上的同时性表达。
它不是一个”发明”。它是二十多个数学家——跨越两千年——各自发现了不同的数学真理。然后在2026年的某个数据中心里,这些真理第一次被同时调用。它们的相互作用产生了某种涌现性质——理解语言、推理、生成——这些性质不是任何一个单独的定理能推导出来的。
(ps:这可能是AI最神秘的地方。我们完全理解每一个底层数学工具——矩阵乘法的每一步、反向传播的每一条链式规则、交叉熵损失的每一次计算。我们不完全理解——当这些工具被用在万亿参数的规模上时——为什么它们能产生”理解”。我们只知道它们确实产生了。也许这就是庞加莱在1908年心理学演讲中描述的那个过程:无意识——subliminal self——将碎片组合成有意义的整体。 我们理解了每一个碎片。但”组合成意义”——发生在某个我们还没到达的维度。)
五、不止是数学。这是人类的文明血脉。
最后——这个系列为什么要写十五篇、六万字?
因为我想让你看到一件事。
当你和AI对话时——你不是只在与一个算法互动。你是在与从欧几里得到庞加莱的全部数学史互动。
每一条反向传播的链式规则——莱布尼茨1676的幽灵。
每一次梯度下降的参数更新——柯西1847的幽灵。
每一层Attention的矩阵乘法——凯莱1858的幽灵。
每一个Token的概率预测——贝叶斯1763的幽灵。
每一个嵌入向量的维度——格拉斯曼1844的幽灵。
每一行 loss = F.cross_entropy(logits, targets) ——克劳修斯、玻尔兹曼、香农的幽灵。
AI不是凭空诞生的。它站在两千五百年的数学累积之上。 那些死去的人——他们不知道我们在用他们的定理做什么。但当他们发现那些真理时——那些推演、那些证明、那些灵光闪念——他们知道他们发现的东西是真的。不是被认可的”真”。不是获得名利的”真”。而是——不管有没有人认可,不管有没有人引用,不管你会不会因为发现它而被纪念——这个定理是真的。它是宇宙的数学结构的一部分。一旦被发现,它就永远在那里。等一个足够大的机器。等一个足够大胆的文明。
这就是龙鹰镖局这个系列想说的最后一句话:
中美博弈大变局,百年未有新财富。而这场变局最底层的驱动力——是你正在读这段话时,那五百个死去的数学家在一百块H100芯片上的集体还魂。
*没有什么比这更让人谦卑。所有我们引以为傲的AI能力——语言、推理、生成——都不是我们的发明。它们是两千年来人类最聪明的头脑一层层剥离出的宇宙真理。我们只是找到了足够快的芯片来同时运行它们。GPT不是我们的孩子。它是欧几里得、高斯、黎曼的孩子。它在代码里。在硅片里。在大脑最深层的数学直觉里。我们说”机器学会了理解语言”。更准确的描述也许是——数学终于长出了语言的形状。 *
(全系列完)