当AI开始做数学:从IMO银牌到研究级证明,机器的”数学直觉”从何而来
副标题:18个月前,AI还在IMO上挣扎。现在,它以$117的成本解出了30位数学教授出的研究级难题。
2026年6月4日,哈佛大学CMSA中心。30位数学家聚集在一个房间里。没有摄影师,审稿人姓名保密。
他们的任务:评判四套AI系统交上来的39份数学解答。
这不是竞赛题。这是他们自己——一线数学家——在各自研究过程中自然遇到的、从未在互联网上公开过的问题。
两天后,结果出来了。
10道题中,7道被至少一套AI系统以”发表级质量”解决。
最有意思的是OpenAI的ChatGPT 5.5 Pro:它交卷最快(5.8小时),花费最少(总共$117),独自答对了4-5道题。
更离谱的是Problem 5——一道关于随机偏微分方程的研究级难题。有一套系统给出的解法,与人类出题人的标准答案完全不同,而且被裁判认为”令人印象深刻”。
Scientific American的标题很克制:《AI在最难数学测试中得分C–》。
但任何一个了解这个领域的人都知道:这张”不及格”的成绩单,恰恰是最令人恐惧的东西。
因为仅仅18个月前,最好的AI系统在IMO上连入场资格都没有。
一、18个月,三次跳跃
让我们回到2024年初。
那时的AI,在真正的数学面前,什么都不是。
能够稳定解决IMO最简题的AI系统,一只手数得过来。稍微难一点的——尤其是需要”灵感”而非”计算”的题目——大模型只会胡言乱语。
然后,一切都变了。
跳跃一:2024年7月——银牌
Google DeepMind的AlphaProof登场。
它做了什么?它证明了2024年IMO的第6题。
第6题是那一年最难的题——全场609名人类选手中,只有5个人拿到了满分7分。
AlphaProof不仅解出了P6,还解出了P1(代数)和P2(数论)。加上AlphaGeometry 2解出的几何题P4,总分28/42——银牌,距离金牌线只差1分。
需要说明的是:AlphaProof花了两三天才解出每道题(人类选手只有4.5小时×2天),而且解题前需要人工将题目翻译成Lean语言。
但是。
在AlphaProof之前,没有任何AI系统在IMO上拿过任何级别的奖牌。 这道墙,被推倒了。
AlphaProof是怎么做到的?核心是两样东西:
第一,Lean定理证明器。 这是一门专门用来写数学证明的编程语言。它的编译器像一个绝对公正的裁判——你说的每一步推理,它都能检查是否真的能从前提中推导出来。没有灰色地带,没有”看起来对”。
第二,Test-Time RL。 AlphaProof在拿到一道题后,不会直接尝试解答。它会在推理时(不是训练时)自动生成数百万个与这道题相关但不完全相同的变体问题,在这些变体上继续强化学习,让自己的”解题策略”针对这道具体题目进行专门适应。
用一句话概括:AlphaProof不是”从题库里找答案”,而是”拿到题之后,花两三天时间,现场进化出一个专门解这道题的神经网络。”
ps: 这就像你要考一场试,不是考前复习,而是进考场后先冥想72小时,等到想通了才开始答题。人类做不到,但AI可以。
跳跃二:2026年1月——金牌,而且是中国制造
2026年1月26日,Nature Machine Intelligence的封面文章,来自一支中国团队。
TongGeometry。
团队来自北京通用人工智能研究院(BIGAI)和北京大学。项目干了两年。“Tong”是中文”通”——通用之意。
但TongGeometry做的事情,一点都不”通”。它是专到了极致。
这个系统做了什么?
它生成了67亿个几何定理。其中41亿个具有数学对称性——一种在竞赛中极受推崇的美学品质。
然后,它从中挑出10道题,提交给了真实数学竞赛。
3道题被选中。
- 1道入选2024年全国高中数学联赛(北京)——中国IMO国家队选拔赛的几何题
- 2道入围2024年美国Ersatz数学奥林匹克(USEMO)——美国顶级民间数学竞赛
你读对了吗?AI出的题,被用来选拔人类国家队。
这不是”AI做学生的作业”,这是”AI当上了出题的老师”。
与此同时,TongGeometry在IMO-AG-30基准上——23年IMO几何题的全集——解出了全部30道。 这使它成为第一个在IMO几何领域超越人类金牌选手平均水平的自动化系统。
最让人难以理解的数据是这个:
硬件配置:32个CPU核心 + 1张RTX 4090显卡。这是你花两万块人民币就能在京东买到的配置。
对比AlphaGeometry:需要246个CPU核心 + 4张V100专业显卡,而且最多只能解出IMO-AG-30中TongGeometry提出的10道题中的3道。
中国团队用消费级硬件,干了DeepMind用数据中心才能干的事。 这不是一个性能比较,这是一个范式差异。
TongGeometry的技术哲学是怎样的?它不是”更大力度的蛮力搜索”,而是重新理解了几何问题的空间结构。
论文中有一段非常精彩的话:
“我们的主要科学贡献不在于增量性能提升,而在于对几何问题空间本身的基本重新表征和理解。”
翻译成人话:DeepMind的AlphaGeometry是”更聪明的学生”。TongGeometry是”更深刻的教练”。
学生只会解题。教练理解知识的结构。
跳跃三:2026年6月——从竞赛题到研究级
First Proof项目的第二批测试,把游戏规则彻底改写了。
项目由四位顶级数学家(Mohammed Abouzaid、Nikhil Srivastava、Rachel Ward、Lauren Williams)发起。核心逻辑很简单:
“当前大多数数学基准测试评估的是AI在竞赛题上的表现——这是一个与实际研究者创造性数学工作完全不同的领域。”
所以他们自己做了一个基准。10道题。每道题都来自作者的研究过程中自然产生的问题,在网上从未出现过,答案只有出题人自己知道。
这消除了AI”背诵答案”的可能性——因为答案根本就不存在于训练数据中。
四套系统接受了测试:
| 系统 | 成绩 | 成本 | 用时 |
|---|---|---|---|
| IMProofBench(ETH/Aarhus) | 6-7题 | $3,186 | 22.9小时 |
| UCLA Moonshot(含陶哲轩) | ~5题 | $4,799 | 23.1小时 |
| ChatGPT 5.5 Pro(OpenAI) | 4-5题 | $117 | 5.8小时 |
| Princeton Momus | ~2题 | $1,014 | 7.8小时 |
几个细节值得展开:
1. IMProofBench的成绩最好,但它不是一个模型,而是一个”委员会”——GPT-5.5 Pro遇到困难时,会咨询Gemini和Claude组成的”专家组”。这是一种让多个AI互相对话、互相纠错的架构。结果证明,这种”AI辩论”比单个AI想得更深。
2. UCLA Moonshot的团队名单里,赫然出现了Terence Tao(陶哲轩)的名字。 这位可能是当今最伟大的在世数学家,亲自参与了AI数学系统的搭建。他和UCLA的学生们用GPT-5.5 Pro做底层模型,在上面搭建了一套完整的数学推理流水线。
3. ChatGPT 5.5 Pro独狼作战,$117干了5.8小时,效率最高。 它用的只是OpenAI给出的标准prompt——“请认真考虑问题,提供完整严谨的证明……”然后就开始干活了。没有复杂的多模型协商,没有精巧的脚手架。就是裸奔。但裸奔也解出了将近一半的研究级问题。
4. Problem 4(度量几何)全军覆没。 没有一套系统取得任何有意义的进展。这说明AI数学能力存在明确的”盲区”——某些数学领域仍然是不可逾越的。
二、“数学直觉”——一个你不理解的词
读到这里,你可能会有疑问:这些系统到底在”理解”数学,还是只是在”计算”数学?
这个问题没有简单的答案。但有一些线索。
线索一:AlphaProof不靠背诵。
AlphaProof的TTRL机制意味着:它在面对一道从未见过的问题时,不是去检索记忆中的相似题目,而是现场生成数百万个相关变体,通过在这些变体上强化学习来”进化”出解题策略。
如果把记忆比作查字典,TTRL就像是在考试现场重新学了一遍整个学科。
线索二:TongGeometry不只是解题器。
TongGeometry能出题——而且是能被国家队选拔赛选中的高质量题。出题需要的是对知识结构的深刻理解,而不仅仅是解题技巧。
一个”解题器”知道怎么从A走到B。一个”出题器”知道为什么A到B这条路是美的、有趣的、值得走。
线索三:Aristotle做出了原创贡献。
Harmonic的Aristotle系统(IMO 2025金牌级),在训练过程中对Mathlib——全球最大的开源数学知识库——做出了原创贡献。它发现了一本流行教材中的细微错误,还在范畴论和同调代数等远超IMO难度的领域展现了能力。
这不是刷题。这是在推动知识前沿。
线索四:First Proof Problem 5的新解法。
那套系统给出的随机偏微分方程解法,与人类出题人的标准答案不同——但也被判为正确。
出现了什么?AI找到了另一条路。 不是模仿人类的思路,而是自己发现了一条路。
三、一场”形式与非形式”的路线之争
如果你仔细看这场风暴的参与者,会发现他们分成两派:
| 形式化派 | 非形式化派 | |
|---|---|---|
| 代表 | AlphaProof, Aristotle, TongGeometry | OpenAI GPT, Google Gemini |
| 方法 | 用Lean语言生成机器可验证的证明 | 用自然语言生成人类可读的推理 |
| 优势 | 100%正确,零幻觉 | 灵活度高,覆盖面广 |
| 劣势 | 需要人工将问题翻译成Lean | 可能有隐藏的逻辑错误 |
| 应用 | 高可靠性场景(代码验证、安全关键系统) | 通用数学辅助、研究灵感 |
目前最成功的系统都是混合的。
Aristotle的核心架构就是”双系统”:先用LLM生成非形式化的证明策略(“直觉”),再用Lean形式化验证每一步(“严谨”)。如果验证失败,把错误信息反馈给LLM,重新生成策略。
这模仿了人类数学家的思维模式:
- 系统1(快、直觉):“这个不等式应该能用归纳法搞定”
- 系统2(慢、严谨):逐行写下来,检查每一步逻辑是否成立
AI第一次同时拥有了”直觉”和”严谨”。
ps: 这听起来很可怕。但更可怕的可能是——人类数学家之所以能做出伟大的发现,很大程度上就是因为这两个系统的完美配合。现在AI学会了这套。下一步会是什么?
四、速度的困惑
让我们拉出一张时间线:
| 时间 | 事件 |
|---|---|
| 2024年初 | AI在IMO上基本无能为力 |
| 2024年7月 | AlphaProof IMO银牌(历史首次) |
| 2025年7月 | Aristotle, OpenAI, DeepMind, ByteDance 四方同时宣布IMO金牌级 |
| 2026年1月 | TongGeometry:AI出题入选国家队选拔 |
| 2026年6月 | First Proof:AI以$117解出研究级问题 |
有人会问:“这不就是刷榜吗?有什么了不起?”
区别在于刷榜的”坡度”。
在AI历史上,从”刚入门”到”人类顶尖”的跨越,通常需要3-5年。围棋(AlphaGo)用了大约2年从业余到超越人类。蛋白质折叠(AlphaFold)用了4年。
数学用了18个月。
而且这个速度还在加快。因为每一个新的AI数学系统,都在为下一个系统生成训练数据。TongGeometry的67亿几何定理,可以喂给下一个神经网络。AlphaProof的解题轨迹,可以训练更强的证明策略。这是个自我加速的飞轮。
更关键的是:数学是其他所有科学的基础。
AI学会了做数学 = AI学会了物理学、化学、生物学的底层语言。这不是一个领域的突破,这是一扇通往所有定量科学的大门。
2025年10月,Harmonic的CEO Tudor Achim在接受采访时被问到:“AI什么时候能在特定数学任务上超越人类数学家?”
他的回答是——
“两到三年内。不是有些人说的十年。”
六个月后的2026年6月,陶哲轩——这位菲尔兹奖得主,UCLA Moonshot Harness的导师——在ICM 2026的讲台上,向全世界的数学家发出了一封公开信。
他给它取了一个名字。
“证明消化不良”(Proof Indigestion)。
AI正在以人类无法消化的速度生成证明。验证跟不上。理解跟不上。整理跟不上。
数学界即将从”证明稀缺时代”进入”证明过剩时代”。
而在这种过剩中,最可怕的问题不是”AI能不能做数学”,而是——
当AI生成的证明被编译器确认100%正确,但没有任何人类能理解这个证明的时候——
这还算数学吗?
“两年前我们问:AI什么时候能做出IMO的题?一年前我们问:AI什么时候能帮数学家做研究?今天,我们开始问一个更根本的问题:当AI比任何人更懂数学的那一天,人类在数学中的位置是什么?”
下一篇预告:《陶哲轩的警告与预言——当证明多到人类消化不了》