中文

基于神经网络与长期预测的更强计算机围棋程序

机器学习 2016-03-01 v3 人工智能

摘要

在古老的围棋游戏中与人类顶尖棋手竞争一直是人工智能的长期目标。围棋的高分支因子使得传统搜索技术即使在高性能硬件上也低效,且围棋的评估函数可能因一子之变而剧变。近期工作[Maddison et al. (2015); Clark & Storkey (2015)]表明搜索对于机器学习围棋棋手并非绝对必要。一种基于深度卷积神经网络(DCNN)预测下一步的纯模式匹配方法,在搜索预算受限时,其表现可媲美基于蒙特卡洛树搜索(MCTS)的开源围棋引擎(如Pachi [Baudis & Gailly (2012)])。我们在名为darkforest的机器人中扩展了该思路,它依赖于为长期预测设计的DCNN。即使搜索预算更宽松,darkforest也大幅提升了模式匹配方法对基于MCTS方法的胜率。面对人类棋手,最新版本darkfores2作为排名机器人在KGS围棋服务器上达到稳定的3d水平,相比Clark & Storkey (2015)中基于与其他机器棋手对弈估计的DCNN的4k-5k段位有显著提升。为darkfores2加入MCTS创建了一个更强的棋手darkfmcts3:以5000次rollouts,它在全部250局中击败了10k rollouts的Pachi;以75k rollouts它在KGS服务器上达到稳定的5d水平,除AlphaGo [Silver et al. (2016)]外与最先进的围棋AI(如Zen, DolBaram, CrazyStone)相当;以110k rollouts,它在1月KGS围棋锦标赛中获得第三名。

关键词

引用

@article{arxiv.1511.06410,
  title  = {Better Computer Go Player with Neural Network and Long-term Prediction},
  author = {Yuandong Tian and Yan Zhu},
  journal= {arXiv preprint arXiv:1511.06410},
  year   = {2016}
}

备注

10 pages, 9 without references. Submission for ICLR 2016