第37手:一颗不属于人类的棋子,如何让围棋2500年的历史重新开始

原创出品 | 龙鹰镖局


2016年3月10日。首尔四季酒店。

李世石从棋盘前站起来,走出对局室,在走廊里点燃了一根烟。这是第二局。昨天他已经输了一盘。今天他换了策略——稳健。等待AlphaGo犯错。人类棋手总有弱点。总会犯错的。等着就好。

第36手之后,李世石起身去抽烟。他需要那一根。对局室里,一个叫黄士杰的台湾工程师安静地坐在棋盘对面。他的工作是把AlphaGo的棋步从屏幕上搬到棋盘上。他不是棋手。他只是手。

然后第37手出现了。

黄士杰把黑子放在棋盘右侧——五路。那是一个”肩冲”。围棋里再常见不过的战术。但五路的肩冲不是战术。是禁忌。

隔壁评论室里,全世界最顶尖的西方围棋棋手迈克尔·雷德蒙德(Michael Redmond,职业九段)正在向全球数亿观众做直播解说。他看到屏幕上的第37手——拿起一颗黑子放在自己面前的棋盘上。退后一步,看了一秒。

“不,这不可能是正确的。”

他把黑子拿起来。又看了一眼屏幕。又放了回去。

“这确实是AlphaGo下的。”

后来,AlphaGo团队回溯数据时发现:在这步棋之前几手,AlphaGo甚至没有考虑过37。它原本计划了一条常规路线。是李世石的第36手改变了局面——AlphaGo在那个瞬间重新评估了整个棋盘,然后得出了一个结论:这个五路肩冲,胜率最高。

人类棋手选择这一步的概率:万分之一。

李世石从走廊回来。走到棋盘前,看到第37手。他愣住了。然后笑了一下。坐下来。想了整整十二分钟。 计时器在走。李世石的表情从微笑变成严肃,从严肃变成困惑。十二分钟后,他走了第38手——这步棋的方向明显有问题。37不仅帮了AlphaGo在棋盘上——它直接击垮了李世石的心理平衡。

AlphaGo的胜率,从这一刻开始缓缓攀升。

而在第37手落下整整一百多手之后——第211手,李世石投子认输。所有回看这盘棋的专业棋手都得出同一个结论:如果这盘棋有任何一步决定了胜负,那就是第37手。 那不是一步棋。那是一个全新的围棋宇宙的入口。


一、最后一堵墙

先退后一步。为什么AlphaGo的出现如此震撼?

1997年深蓝击败卡斯帕罗夫。那时国际象棋的”机器统治”已是大势所趋——深蓝每秒算2亿步,暴力搜索到12步甚至70步。国际象棋的棋盘是8×8的。围棋的棋盘是19×19的。

围棋的可能局面数:10的171次方。宇宙中的原子总数:10的80次方。

(ps:这个数字到底是什么概念?如果宇宙中的每一颗原子都包含一整个宇宙,而那一整个宇宙中每一颗原子又包含一整个宇宙——在嵌套了两层之后,所有原子的总数仍然不到围棋的可能的局面数。暴力搜索在围棋上没有任何意义。无论你算得多快,都算不完。这就是为什么围棋一直被认为是AI的”最后一堵墙”——不是一堵能被”堆更多算力”推倒的墙。)

在AlphaGo之前,最好的围棋AI连业余高手都打不过。职业九段能让他们四个子。2014年,大多数AI专家预测计算机在围棋上击败人类冠军还需要十年以上。

然后2015年10月。DeepMind悄然邀请欧洲围棋冠军樊麾(职业二段)来伦敦,进行了一场闭门五番棋。AlphaGo 5-0。次年1月,《自然》杂志以封面文章发表了AlphaGo的技术论文。3月,DeepMind宣布:AlphaGo将在首尔挑战李世石——过去十年地球上最强的围棋棋手,18次国际冠军。奖金100万美元。

李世石在赛前接受采访时说——

“我会尽全力捍卫人类智能的尊严。”

他预测自己会赢。要么5-0,要么4-1。

全世界的围棋职业棋手都同意。击败一台没有经验的电脑,将是顶级职业棋手赚100万美元最容易的方式。没有人——没有人类——认为AlphaGo会赢。


二、一间安静的房间

比赛在首尔四季酒店举行。全球超过2亿人观看了直播——比超级碗的观众还多。谷歌的埃里克·施密特从加州飞来。谢尔盖·布林三天后也来了。韩国街头装上了大屏幕。

对局室很小,很安静。只有一张棋盘、两把椅子、一面计时器——和李世石对面坐着的黄士杰,以及他那台连接着美国服务器的笔记本电脑。

AlphaGo不懂围棋。

它不知道什么是”厚势”。不知道什么是”好形”。不知道吴清源、李昌镐、李世石本人写下的任何一条围棋理论。AlphaGo只有一个目标——不是”赢最多的目数”,而是最大化获胜概率

(ps:这个细微的差别极其重要。人类棋手下棋追求”优势”——领先越多越好。AlphaGo只追求”胜率”。如果AlphaGo必须在”以80%概率赢20目”和”以99%概率赢半目”之间选择——它会毫不犹豫地选择后者。这就是为什么AlphaGo有时候会走出看起来奇怪的”缓手”——它在主动放弃目数,因为多赢几目对胜率没有帮助,但稳住局势有。这和人类围棋哲学有本质不同。它不是在下棋——它是在做概率管理。

它的神经网络被训练在三个层次上工作:

策略网络——扫描棋盘,判断哪些点值得下。这是在3000万手人类职业棋谱上训练出来的。它学会了”哪些走法看起来像人类的好棋”。

价值网络——评估任意一个棋盘局面的胜率。不是算目数。是直接判断”谁更可能赢”。这个网络是通过数百万次自我对弈训练出来的。

蒙特卡洛树搜索——结合策略网络的”直觉”和价值网络的”判断”,在可能的下棋路径中寻找最优解。它不会穷举所有可能性——那在围棋上是不可能的。它只沿着最有希望的路径往前走,走五六十步,评估一下,再决定该不该继续走下去。

DeepMind的CEO德米斯·哈萨比斯用了一个比喻:“AlphaGo像一个结合了直觉和计算的棋手。策略网络提供’感觉’——这步棋看起来好不好。价值网络提供’判断’——这个局面我赢的概率是多少。树搜索提供’计算’——让我往前多算几步确认一下。”

这就是AlphaGo的秘密。不是蛮力。不是围棋知识。是学会学习


三、一颗不属于人类的棋子

现在回到第二局的第37手。让我们仔细看这一刻。

AlphaGo的对手不仅是李世石,还有2500年的围棋理论。

在围棋的传统教义中——在从吴清源到李昌镐到李世石本人的所有职业棋谱中——在边线争夺中,三路和四路是”公平交易”的界限。三路确保实地。四路换取外势。如果走到五路——那你给了对手太多的实地,换回来的影响力不足以补偿。没有一个有经验的职业棋手会在第37手的位置走五路肩冲。

没有一个。

除了AlphaGo。

事后分析显示:这步五路肩冲在棋盘上撒下了一张无形的网。它不是一步”就地取利”的棋。它是一步”战略性投资”——放弃了右边局部的四路实地,换取了整个中腹的辐射性潜力。在AlphaGo的评估里,这种潜力在接下来几十步以后将以更高的概率转化为胜势。

人类围棋花了2500年没有发现这种可能性。

AlphaGo在几秒钟内发现了它。而且——它是在李世石走了第36手之后才”顿悟”的。 在36之前,AlphaGo自己也没想到37。是李世石的棋改变了棋局的评估,AlphaGo在那个瞬间发现了新的最优解。

(ps:事后樊麾在DeepMind的官方分析中写道:“当我们后来查看AlphaGo的数据时发现,就在几步之前,AlphaGo甚至没有在考虑37。它原本预计的是另一条路线。它的数据显示人类棋手几乎不会考虑这步肩冲。正是李世石的白36使AlphaGo发现了37,并大胆地判断这步棋的胜率更高。“这不是预谋。这是现场的、基于数据的创造性。

当那颗黑子落在五路时——李世石的世界裂开了。

他在棋盘前坐了十二分钟。表情在他脸上演完了一整场电影:困惑→震惊→思考→不安。

然后AlphaGo赢了。

赛后新闻发布会上,李世石说——

“昨天我很惊讶。今天我无话可说。AlphaGo下了一盘近乎完美的棋。从开局到结束,我没有一刻觉得自己领先。”

当记者问他AlphaGo的弱点是什么,他说——

“显然我还没找到。“


四、人类的最后一击

三天后。比分已经是3-0。AlphaGo赢了前三盘。五番棋的胜负已定。但按照约定,剩下两盘还是要下完。

第三局结束后,李世石在新闻发布会上向全人类道了歉。

“我感到有些无力。”

第四局。李世石执白。中场过后,AlphaGo几乎已经锁定了胜利。胜率评估超过70%。

然后——

第78手。

一颗白子楔进了AlphaGo判断为”安全”的区域。不是常见的走法。不是”正着”。是一步极度罕见的、创造性的、铤而走险的楔。中国的世界冠军古力在解说室里看到这一手,直接喊出来——

“神之一手!”

更晚的数据显示:AlphaGo的策略网络计算一个人类棋手会选择这一步的概率——也是万分之一。

历史的对称令人窒息:第37手是机器的”神之一手”。第78手是人类的”神之一手”。概率完全一样。一万分之一对一万分之一。

但从第79手开始,AlphaGo崩溃了。

它的胜率评估直线坠落。从70%以上跌到55%。再跌到30%。这是整个系列赛中第一次出现这样的情况。AlphaGo开始走出令人费解的棋步——奇怪的交换、无意义的自损。黄士杰——那个从开赛以来一直面无表情坐在棋盘前的工程师——突然用一种困惑的眼神看向DeepMind团队。

好像在问:“发生了什么?!”

后来分析显示,第78手触发了蒙特卡洛树搜索的一个已知弱点:当人类走出一手远远超出AI”搜索雷达”范围的棋时,树搜索在之前的剪枝中已经把那条路径完全砍掉了。它看不见。被盲了。

AlphaGo在那一瞬间,像一个人撞上了一堵从未想象过的墙。

它”慌了”。

第180手,AlphaGo认输。

李世石笑了。整个韩国的街头在欢呼。一个佛罗里达的程序员后来把第37手和第78手的棋形纹在了手臂上——两颗永远不会被忘记的棋子。

赛后李世石说——

“我非常高兴和自豪——也许这是最后一次,我代表人类,找到了一种战胜机器的方式。”

(ps:这句话现在读起来让人心悸。他说对了。那是人类最后一次在正式比赛中战胜顶尖围棋AI。 一年后,AlphaGo Master在乌镇以3-0击败世界排名第一的柯洁。柯洁赛后在走廊里哭了一个小时。再后来,AlphaGo Zero在没有使用任何人类棋谱、纯粹靠自我对弈训练了三天的情况下,以100-0击败了打败李世石的那个版本。人类的”神之一手”——第78手——是终曲。是回光。是日落前最后一缕霞光。)


五、新的棋谱

李世石在那场比赛之后,连续赢了九盘职业对局。

记者问他秘诀是什么。他只说了一句——

“不要依赖直觉。用最高的精度去计算。”

2019年。李世石宣布退役。他说他再也无法从围棋中感受到快乐了——“即使我成为世界第一,也有一个无法被击败的存在。”

但围棋没有死。

AlphaGo离开之后,围棋反而进入了一个黄金时代。职业棋手们开始研究AlphaGo的对局——尤其是第37手。他们逐渐理解了那步棋背后的逻辑:五路的肩冲在特定局面下是好的。外势比过去认为的更有价值。中腹的潜力可以补偿边缘的实地损失。整个围棋理论的边界被推开了。

机器不是来终结围棋的。机器是来教人类如何下更好的围棋的。

樊麾后来在一次采访中说——

“第37手超越了所有传统教义。没有有经验的人类棋手会走出这一步。AlphaGo的计算显示人类棋手选择这一步的概率只有万分之一。这是一个灵感时刻——来自AlphaGo对围棋的独特理解。它不受人类传统、人类理论、人类教义的束缚。它自己学会了围棋。这使得它的思维是自由的——而这种自由,反过来又一次解放了我们。”

哈萨比斯用了一个更宏大的比喻:第37手也许是我们第一次看到那幅图景——人类利用AI作为一个强大的新工具,来发现我们从未知道的知识,来解决我们最紧迫的科学难题。

蛋白质折叠。材料科学。数学证明。核聚变。围棋。

如果AlphaGo能在2500年的围棋理论中发现人类从未见过的走法——那它在任何一个被人类研究了足够久的领域里,都有可能做出同样的事。


棋盘上的两颗星

首尔四季酒店的那间对局室现在已经不在了。

棋盘被收走了。计时器被关了。椅子搬到了不知道什么地方。黄士杰回到了英国。李世石去了别的生活。

但有一样东西留了下来:

两颗棋子。一颗黑的。一颗白的。

黑色那一颗——第37手——是AI在人类文明史上下出的第一颗完全不属于人类传统的棋子。它不是”更快地计算”。不是”更深地搜索”。它是一种新的思考方式——不受2500年教条束缚的、纯粹的、对围棋的重新理解。

白色那一颗——第78手——是人类在被不可战胜的力量三连碾压之后,从绝望的深渊里挖出来的、最后一次绽放。它证明了一件事:即使对面是不可能被理解的智能,人类的创造力仍然可以刺穿它——哪怕只有一次。

围棋棋盘上有361个交叉点。

第37手和第78手,改变了这道题的答案。


原创出品:龙鹰镖局

「AI群星闪耀时」系列 · 第七篇 上一篇:第六篇 · 2012,ImageNet时刻——两张游戏显卡劈开了AI世界 下一篇预告:2017,改变世界的八页纸——一篇没人觉得特别的论文,八个不知道自己在创造历史的科学家。Transformer这个词,后来成了AI时代的蒸汽机


参考资料:DeepMind AlphaGo官方第二局技术分析(Fan Hui/Gu Li/Zhou Ruiyang);Nature 2016 AlphaGo论文;纪录片”AlphaGo”(2017);DeepMind 10周年回顾(Thore Graepel & Pushmeet Kohli, 2026);Wikipedia AlphaGo vs. Lee Sedol;红杉资本十周年回顾(2026);Michael Redmond实况解说;DongA Science第二局专业分析等