当AI开始做数学:从IMO银牌到研究级证明,机器的”数学直觉”从何而来

副标题:18个月前,AI还在IMO上挣扎。现在,它以$117的成本解出了30位数学教授出的研究级难题。


2026年6月4日,哈佛大学CMSA中心。30位数学家聚集在一个房间里。没有摄影师,审稿人姓名保密。

他们的任务:评判四套AI系统交上来的39份数学解答。

这不是竞赛题。这是他们自己——一线数学家——在各自研究过程中自然遇到的、从未在互联网上公开过的问题。

两天后,结果出来了。

10道题中,7道被至少一套AI系统以”发表级质量”解决。

最有意思的是OpenAI的ChatGPT 5.5 Pro:它交卷最快(5.8小时),花费最少(总共$117),独自答对了4-5道题。

更离谱的是Problem 5——一道关于随机偏微分方程的研究级难题。有一套系统给出的解法,与人类出题人的标准答案完全不同,而且被裁判认为”令人印象深刻”。

Scientific American的标题很克制:《AI在最难数学测试中得分C–》。

但任何一个了解这个领域的人都知道:这张”不及格”的成绩单,恰恰是最令人恐惧的东西。

因为仅仅18个月前,最好的AI系统在IMO上连入场资格都没有。


一、18个月,三次跳跃

让我们回到2024年初。

那时的AI,在真正的数学面前,什么都不是。

能够稳定解决IMO最简题的AI系统,一只手数得过来。稍微难一点的——尤其是需要”灵感”而非”计算”的题目——大模型只会胡言乱语。

然后,一切都变了。

跳跃一:2024年7月——银牌

Google DeepMind的AlphaProof登场。

它做了什么?它证明了2024年IMO的第6题。

第6题是那一年最难的题——全场609名人类选手中,只有5个人拿到了满分7分。

AlphaProof不仅解出了P6,还解出了P1(代数)和P2(数论)。加上AlphaGeometry 2解出的几何题P4,总分28/42——银牌,距离金牌线只差1分。

需要说明的是:AlphaProof花了两三天才解出每道题(人类选手只有4.5小时×2天),而且解题前需要人工将题目翻译成Lean语言。

但是。

在AlphaProof之前,没有任何AI系统在IMO上拿过任何级别的奖牌。 这道墙,被推倒了。

AlphaProof是怎么做到的?核心是两样东西:

第一,Lean定理证明器。 这是一门专门用来写数学证明的编程语言。它的编译器像一个绝对公正的裁判——你说的每一步推理,它都能检查是否真的能从前提中推导出来。没有灰色地带,没有”看起来对”。

第二,Test-Time RL。 AlphaProof在拿到一道题后,不会直接尝试解答。它会在推理时(不是训练时)自动生成数百万个与这道题相关但不完全相同的变体问题,在这些变体上继续强化学习,让自己的”解题策略”针对这道具体题目进行专门适应。

用一句话概括:AlphaProof不是”从题库里找答案”,而是”拿到题之后,花两三天时间,现场进化出一个专门解这道题的神经网络。”

ps: 这就像你要考一场试,不是考前复习,而是进考场后先冥想72小时,等到想通了才开始答题。人类做不到,但AI可以。

跳跃二:2026年1月——金牌,而且是中国制造

2026年1月26日,Nature Machine Intelligence的封面文章,来自一支中国团队。

TongGeometry。

团队来自北京通用人工智能研究院(BIGAI)和北京大学。项目干了两年。“Tong”是中文”通”——通用之意。

但TongGeometry做的事情,一点都不”通”。它是到了极致。

这个系统做了什么?

它生成了67亿个几何定理。其中41亿个具有数学对称性——一种在竞赛中极受推崇的美学品质。

然后,它从中挑出10道题,提交给了真实数学竞赛。

3道题被选中。

  • 1道入选2024年全国高中数学联赛(北京)——中国IMO国家队选拔赛的几何题
  • 2道入围2024年美国Ersatz数学奥林匹克(USEMO)——美国顶级民间数学竞赛

你读对了吗?AI出的题,被用来选拔人类国家队。

这不是”AI做学生的作业”,这是”AI当上了出题的老师”。

与此同时,TongGeometry在IMO-AG-30基准上——23年IMO几何题的全集——解出了全部30道。 这使它成为第一个在IMO几何领域超越人类金牌选手平均水平的自动化系统。

最让人难以理解的数据是这个:

硬件配置:32个CPU核心 + 1张RTX 4090显卡。这是你花两万块人民币就能在京东买到的配置。

对比AlphaGeometry:需要246个CPU核心 + 4张V100专业显卡,而且最多只能解出IMO-AG-30中TongGeometry提出的10道题中的3道。

中国团队用消费级硬件,干了DeepMind用数据中心才能干的事。 这不是一个性能比较,这是一个范式差异。

TongGeometry的技术哲学是怎样的?它不是”更大力度的蛮力搜索”,而是重新理解了几何问题的空间结构

论文中有一段非常精彩的话:

“我们的主要科学贡献不在于增量性能提升,而在于对几何问题空间本身的基本重新表征和理解。”

翻译成人话:DeepMind的AlphaGeometry是”更聪明的学生”。TongGeometry是”更深刻的教练”。

学生只会解题。教练理解知识的结构。

跳跃三:2026年6月——从竞赛题到研究级

First Proof项目的第二批测试,把游戏规则彻底改写了。

项目由四位顶级数学家(Mohammed Abouzaid、Nikhil Srivastava、Rachel Ward、Lauren Williams)发起。核心逻辑很简单:

“当前大多数数学基准测试评估的是AI在竞赛题上的表现——这是一个与实际研究者创造性数学工作完全不同的领域。”

所以他们自己做了一个基准。10道题。每道题都来自作者的研究过程中自然产生的问题,在网上从未出现过,答案只有出题人自己知道。

这消除了AI”背诵答案”的可能性——因为答案根本就不存在于训练数据中。

四套系统接受了测试:

系统成绩成本用时
IMProofBench(ETH/Aarhus)6-7题$3,18622.9小时
UCLA Moonshot(含陶哲轩)~5题$4,79923.1小时
ChatGPT 5.5 Pro(OpenAI)4-5题$1175.8小时
Princeton Momus~2题$1,0147.8小时

几个细节值得展开:

1. IMProofBench的成绩最好,但它不是一个模型,而是一个”委员会”——GPT-5.5 Pro遇到困难时,会咨询Gemini和Claude组成的”专家组”。这是一种让多个AI互相对话、互相纠错的架构。结果证明,这种”AI辩论”比单个AI想得更深。

2. UCLA Moonshot的团队名单里,赫然出现了Terence Tao(陶哲轩)的名字。 这位可能是当今最伟大的在世数学家,亲自参与了AI数学系统的搭建。他和UCLA的学生们用GPT-5.5 Pro做底层模型,在上面搭建了一套完整的数学推理流水线。

3. ChatGPT 5.5 Pro独狼作战,$117干了5.8小时,效率最高。 它用的只是OpenAI给出的标准prompt——“请认真考虑问题,提供完整严谨的证明……”然后就开始干活了。没有复杂的多模型协商,没有精巧的脚手架。就是裸奔。但裸奔也解出了将近一半的研究级问题。

4. Problem 4(度量几何)全军覆没。 没有一套系统取得任何有意义的进展。这说明AI数学能力存在明确的”盲区”——某些数学领域仍然是不可逾越的。


二、“数学直觉”——一个你不理解的词

读到这里,你可能会有疑问:这些系统到底在”理解”数学,还是只是在”计算”数学?

这个问题没有简单的答案。但有一些线索。

线索一:AlphaProof不靠背诵。

AlphaProof的TTRL机制意味着:它在面对一道从未见过的问题时,不是去检索记忆中的相似题目,而是现场生成数百万个相关变体,通过在这些变体上强化学习来”进化”出解题策略。

如果把记忆比作查字典,TTRL就像是在考试现场重新学了一遍整个学科。

线索二:TongGeometry不只是解题器。

TongGeometry能出题——而且是能被国家队选拔赛选中的高质量题。出题需要的是对知识结构的深刻理解,而不仅仅是解题技巧。

一个”解题器”知道怎么从A走到B。一个”出题器”知道为什么A到B这条路是美的、有趣的、值得走。

线索三:Aristotle做出了原创贡献。

Harmonic的Aristotle系统(IMO 2025金牌级),在训练过程中对Mathlib——全球最大的开源数学知识库——做出了原创贡献。它发现了一本流行教材中的细微错误,还在范畴论和同调代数等远超IMO难度的领域展现了能力

这不是刷题。这是在推动知识前沿。

线索四:First Proof Problem 5的新解法。

那套系统给出的随机偏微分方程解法,与人类出题人的标准答案不同——但也被判为正确。

出现了什么?AI找到了另一条路。 不是模仿人类的思路,而是自己发现了一条路。


三、一场”形式与非形式”的路线之争

如果你仔细看这场风暴的参与者,会发现他们分成两派:

形式化派非形式化派
代表AlphaProof, Aristotle, TongGeometryOpenAI GPT, Google Gemini
方法用Lean语言生成机器可验证的证明用自然语言生成人类可读的推理
优势100%正确,零幻觉灵活度高,覆盖面广
劣势需要人工将问题翻译成Lean可能有隐藏的逻辑错误
应用高可靠性场景(代码验证、安全关键系统)通用数学辅助、研究灵感

目前最成功的系统都是混合的

Aristotle的核心架构就是”双系统”:先用LLM生成非形式化的证明策略(“直觉”),再用Lean形式化验证每一步(“严谨”)。如果验证失败,把错误信息反馈给LLM,重新生成策略。

这模仿了人类数学家的思维模式:

  • 系统1(快、直觉):“这个不等式应该能用归纳法搞定”
  • 系统2(慢、严谨):逐行写下来,检查每一步逻辑是否成立

AI第一次同时拥有了”直觉”和”严谨”。

ps: 这听起来很可怕。但更可怕的可能是——人类数学家之所以能做出伟大的发现,很大程度上就是因为这两个系统的完美配合。现在AI学会了这套。下一步会是什么?


四、速度的困惑

让我们拉出一张时间线:

时间事件
2024年初AI在IMO上基本无能为力
2024年7月AlphaProof IMO银牌(历史首次)
2025年7月Aristotle, OpenAI, DeepMind, ByteDance 四方同时宣布IMO金牌级
2026年1月TongGeometry:AI出题入选国家队选拔
2026年6月First Proof:AI以$117解出研究级问题

有人会问:“这不就是刷榜吗?有什么了不起?”

区别在于刷榜的”坡度”。

在AI历史上,从”刚入门”到”人类顶尖”的跨越,通常需要3-5年。围棋(AlphaGo)用了大约2年从业余到超越人类。蛋白质折叠(AlphaFold)用了4年。

数学用了18个月。

而且这个速度还在加快。因为每一个新的AI数学系统,都在为下一个系统生成训练数据。TongGeometry的67亿几何定理,可以喂给下一个神经网络。AlphaProof的解题轨迹,可以训练更强的证明策略。这是个自我加速的飞轮

更关键的是:数学是其他所有科学的基础。

AI学会了做数学 = AI学会了物理学、化学、生物学的底层语言。这不是一个领域的突破,这是一扇通往所有定量科学的大门。


2025年10月,Harmonic的CEO Tudor Achim在接受采访时被问到:“AI什么时候能在特定数学任务上超越人类数学家?”

他的回答是——

“两到三年内。不是有些人说的十年。”

六个月后的2026年6月,陶哲轩——这位菲尔兹奖得主,UCLA Moonshot Harness的导师——在ICM 2026的讲台上,向全世界的数学家发出了一封公开信。

他给它取了一个名字。

“证明消化不良”(Proof Indigestion)。

AI正在以人类无法消化的速度生成证明。验证跟不上。理解跟不上。整理跟不上。

数学界即将从”证明稀缺时代”进入”证明过剩时代”。

而在这种过剩中,最可怕的问题不是”AI能不能做数学”,而是——

当AI生成的证明被编译器确认100%正确,但没有任何人类能理解这个证明的时候——

这还算数学吗?


“两年前我们问:AI什么时候能做出IMO的题?一年前我们问:AI什么时候能帮数学家做研究?今天,我们开始问一个更根本的问题:当AI比任何人更懂数学的那一天,人类在数学中的位置是什么?”


下一篇预告:《陶哲轩的警告与预言——当证明多到人类消化不了》