几十年来,古老的围棋游戏一直是人工智能领域最艰巨的挑战之一。其棋盘上可能的变化组合比可观测宇宙中的原子还多,复杂性远超国际象棋。曾经征服国际象棋的蛮力计算方法在围棋面前毫无用武之地。许多专家曾预测,能够击败职业围棋棋手的 AI 至少还需要十年才能出现。
2016 年,这一预测被戏剧性地推翻。DeepMind 的程序 AlphaGo 以 5–0 的比分击败了欧洲围棋冠军樊麾,这一结果超出了所有人的预期,在人工智能和围棋界引起巨大震动。这一突破是如何实现的?答案在于 深度学习 与 树搜索 的巧妙结合,孕育出一个能够以创造力、直觉和精确度进行对弈的 AI。
本文将解析发表在《自然》杂志上的里程碑式论文: 《通过深度神经网络和树搜索精通围棋》 。 我们将探讨 DeepMind 的研究人员如何构建一个融合类人直觉与强大计算的系统——它重塑了机器学习与博弈型 AI 的格局。
围棋难题: 浩如烟海的可能性#为什么围棋对计算机来说如此困难?两个根本挑战使其异常棘手:
庞大的搜索空间:
围棋棋盘是 19×19 的方格,任何时候都有 361 个可能的落子点。可构想的棋局序列数量超过 \(10^{170}\)。相比之下,国际象棋的搜索空间“仅”为 \(10^{120}\) 左右。穷尽所有可能的走法在计算上是不可能的。
复杂的局面评估:
在国际象棋中,一个计算子力和分析棋形的评估函数可以表现良好。但在围棋中,评估一个局面需要把握诸如 地盘、外势 以及一块棋是否“活”的高度抽象概念。没有简单规则能够捕捉这些微妙之处。
早期的围棋程序使用 蒙特卡洛树搜索 (MCTS) , 通过从某个局面出发进行数千次随机“推演” (rollout) ,以估算每步棋的获胜概率。这些程序达到了业余高手的水平,但停滞于此。要突破这一瓶颈,算法必须具备超越蛮力搜索的能力——一种学得的 直觉。
AlphaGo 的核心思想: 教授直觉与判断#AlphaGo 的创新在于为其 AI 架构注入两种关键的类人能力:
策略网络 (直觉) : 决定哪些着法看起来有希望,将广阔的搜索范围缩减到几个可能选项。价值网络 (判断) : 评估某一局面是优势还是劣势,使 AI 能够更少地向前搜索却依然辨识出强势局面。这些网络的训练过程可分为多阶段,如下图所示。
图 1. AlphaGo 的四阶段学习流程结合了人类专家模仿 (监督学习) 、自我对弈改进 (强化学习) 和价值评估。
1. 师从大师 (监督学习策略网络)#旅程从模仿开始。研究人员使用一个 13 层卷积神经网络——即 监督学习 (SL) 策略网络——在 KGS 围棋服务器上超过 3000 万个由高水平人类棋手产生的棋局进行训练。
学习目标很简单: 给定一个局面 \( s \),预测人类专家选择的着法 \( a \)。训练更新规则如下:
\[
\Delta\sigma \propto \frac{\partial \log p_{\sigma}(a \mid s)}{\partial \sigma}
\]该监督学习策略网络在预测人类着法方面达到了 57% 的准确率——较此前 44% 的最佳纪录有了巨大提升。看似微小的准确率提升,却显著增强了对弈实力。
图 2a. 策略网络的准确率直接转化为更强的棋力;更多的滤波器带来更佳预测和更高胜率。
经过监督学习后,AlphaGo 已达到业余高手水平。但模仿只是开始——它还需要学会如何赢。
2. 学会取胜 (强化学习策略网络)#为超越模仿,DeepMind 采用了 强化学习 (RL) 。 他们用与监督模型相同的参数 (\( \rho = \sigma \)) 初始化新的策略网络 \( p_{\rho} \),并让它与旧版本进行 自我对弈 。 这使系统不仅学习人类会怎么下,还能学习什么才是最有效的取胜策略。
每局自我对弈生成一个最终结果: 赢记 +1,输记 −1。网络更新其参数,使得未来更可能选择带来胜利的着法:
\[
\Delta \rho \propto \frac{\partial \log p_{\rho}(a_t | s_t)}{\partial \rho} z_t
\]这一过程重塑了网络的概率分布,使策略倾向于直接提升胜率。成果惊人:
强化学习策略网络在与监督学习网络的对弈中胜率超过 80% 。在不进行任何搜索的条件下,它击败了开源程序 Pachi——胜率高达 85%——尽管后者每步需进行 10 万次模拟。自我对弈极大地改变了 AlphaGo 的直觉,使其能发现人类棋谱中前所未有的模式和开局。
3. 培养判断力 (价值网络)#知道走哪步棋只是成功的一半——判断局面是否有利则是另一半。 价值网络提供了这项关键能力。
价值网络估算在双方都遵循某一策略 \( p \) 的情况下,从给定局面出发的胜率:
\[
v_p(s) = \mathbb{E}\left[ z_t \mid s_t = s, a_{t\ldots T} \sim p \right]
\]直接以完整棋局的结果进行预测会导致过拟合,因为连续局面变化微小。研究人员因此创建了一个包含 3000 万个独立局面 的数据集,每个局面均来自强化学习策略网络的自我对弈。每个局面的最终比赛结果成为训练目标。
网络通过回归训练最小化预测结果与实际结果之间的均方误差:
\[
\Delta\theta \propto \frac{\partial v_{\theta}(s)}{\partial \theta} (z - v_{\theta}(s))
\]价值网络能以毫秒级的速度评估局面,其准确度远胜传统蒙特卡洛方法。
图 2b. 价值网络可在极低计算量下提供精确的结果预测,优于任何模拟方法。
4. 融会贯通: AlphaGo 的树搜索#在训练好直觉与判断力后,AlphaGo 将二者融合到一个改进版的蒙特卡洛树搜索 (MCTS) 算法中。这一结合使得直觉引导探索,价值引导评估。
每一次搜索 (或模拟对弈) 包含四个主要阶段:
图 3. AlphaGo 的蒙特卡洛树搜索集成了学习到的策略先验与价值估计,以智能地探索潜在着法。
选择 (Selection):
从当前棋盘 (树的根节点) 出发,算法选择使得存储价值 \( Q \) 与探索奖励 \( u \) 之和最大化的着法:
\[
a_t = \operatorname*{argmax}_{a}(Q(s_t, a) + u(s_t, a)), \quad u(s,a) \propto \frac{P(s,a)}{1+N(s,a)}
\]这种平衡确保了由策略网络给出的高概率着法被优先探索,同时仍保留发现新策略的可能性。
扩展 (Expansion):
当到达新的叶节点时,策略网络 \( p_{\sigma} \) 为每个可选着法预测先验概率,并将它们加入搜索树。
评估 (Evaluation):
叶节点通过两种互补方式评估:
价值网络: \( v_{\theta}(s_L) \) 提供快速而精确的估计;快速走子模拟: 由简化策略运行至棋局结束,得到具体结果 \( z_L \)。
最终通过混合参数 \( \lambda \) 合并:
\[
V(s_L) = (1 - \lambda) v_{\theta}(s_L) + \lambda z_L
\]反向传播 (Backup):
每个结果 \( V(s_L) \) 会更新路径上的平均行动价值 \( Q \) 和访问次数 \( N \):
\[
Q(s,a) = \frac{1}{N(s,a)} \sum_{i=1}^{n} V(s_L^{i})
\]经过数千次模拟后,AlphaGo 最终选择访问次数最多的着法——即系统预测最有可能赢的那一步。
实验与结果: 衡量真正的实力#DeepMind 进行了大规模的内部锦标赛,以评估 AlphaGo 与其他顶级围棋程序以及自身不同版本的表现。
图 4. AlphaGo 以压倒性优势击败所有竞争对手,胜率高达 99.8%。分布式版本的实力更胜一筹。
主要发现:
单机版 AlphaGo 在与其他程序的 495 场比赛中赢得 494 场 , 胜率达 99.8% 。分布式版本 (运行在 1202 个 CPU 和 176 个 GPU 上) 更强大,对阵单机版时胜率达 77%。结合价值网络与快速推演的混合评估 (\( \lambda = 0.5 \)) 效果最佳,表明两种方法相辅相成。为可视化 AlphaGo 的思考过程,研究人员分析了它在与樊麾的一场非正式比赛中的着法选择。
图 5. AlphaGo 在非正式比赛中的决策快照: 预测与评估的热力图揭示了 AI 如何确定最佳落子。
最终,与三届欧洲冠军 樊麾 的历史性五番棋比赛成为终极考验。AlphaGo 赢得每一局,包括执黑和执白的对局——且没有任何让子。
图 6. AlphaGo 与樊麾正式对局中的一盘。AlphaGo 的落子展现出远超以往 AI 的类人创造力与精准度。
这是历史上第一次计算机在全尺寸围棋比赛中击败人类职业棋手——一个许多人原以为至少还需十年才能实现的里程碑。
结论: 人工智能的转折点#AlphaGo 的成就远不只是一次博弈的胜利——它标志着人工智能领域的范式转变。
过去的系统,如 深蓝,依赖手工编写的规则与蛮力计算;而 AlphaGo 则通过 数据与经验 进行学习。其网络在纯粹的数学基础上形成了风格、直觉和理解力。它每秒评估的局面比深蓝少得多,但评估却更智能——以神经网络的洞察力完成决策,令人联想到人类棋手的思考方式。
通过将神经网络与经典搜索相结合,AlphaGo 提供了应对其他重大挑战的蓝图——那些涉及巨大搜索空间与复杂评估的问题,从科学发现到医疗诊断皆然。
当 AlphaGo 将黑白棋子落在棋盘上时,它不仅宣告了 AI 在围棋中的胜利,更开启了一个新时代: 机器能够真正学会掌握人类有史以来最复杂的系统。