中文

超越蒙特卡洛树搜索:使用深度交替神经网络与长期评估下围棋

人工智能 2017-06-14 v1 机器学习 神经与进化计算

摘要

蒙特卡洛树搜索(MCTS)在计算机围棋中极为流行,它通过在宽而深的搜索树中进行大量模拟来确定每个动作。然而,人类专家主要通过模式分析和仔细评估来选择大多数动作,而不是对未来数百万次交互进行暴力搜索。在本文中,我们提出了一种遵循专家思维和下棋方式的计算机围棋系统。我们的系统由两部分组成。第一部分是一个新颖的深度交替神经网络(DANN),用于生成下一手的候选着法。与现有的深度卷积神经网络(DCNN)相比,DANN 在每个卷积层之后插入循环层,并以交替方式堆叠它们。我们表明这种设置可以保留更多局部特征的上下文及其演化,这有利于着法预测。第二部分是一个长期评估(LTE)模块,用于提供对候选着法的可靠评估,而不是仅来自着法预测器的单一概率。这符合人类专家的下棋天性,因为他们可以预见数十步以对候选着法给出准确估计。在我们的系统中,对于每个候选着法,LTE 在局部变化确定后的几次未来交互中计算累积奖励。结合这两部分的标准,我们的系统确定下一手的最佳选择。为了进行更全面的实验,我们引入了一个新的职业围棋数据集(PGD),包含 253233 条职业对局记录。在 GoGoD 和 PGD 数据集上的实验表明,与纯 DCNN 相比,DANN 可以显著提高着法预测的性能。当结合 LTE 时,我们的系统优于大多数相关方法和基于 MCTS 的开源引擎。

关键词

引用

@article{arxiv.1706.04052,
  title  = {Beyond Monte Carlo Tree Search: Playing Go with Deep Alternative Neural Network and Long-Term Evaluation},
  author = {Jinzhuo Wang and Wenmin Wang and Ronggang Wang and Wen Gao},
  journal= {arXiv preprint arXiv:1706.04052},
  year   = {2017}
}

备注

AAAI 2017