中文

利用深度神经网络与人类数据在疯狂象棋变体中学习达到世界冠军水平以上的对弈

人工智能 2020-09-11 v2 机器学习

摘要

深度神经网络已通过强化学习在无先验知识的情况下成功应用于围棋、国际象棋和将棋等棋盘游戏的学习。尽管从零知识起步已被证明能取得令人印象深刻的成果,但其伴随着高昂的计算成本,尤其对于复杂游戏而言。本文提出 CrazyAra,这是一个仅以监督方式训练用于疯狂象棋(crazyhouse)变体的基于神经网络的引擎。疯狂象棋的分支因子高于国际象棋,且相较于 AlphaGo 仅有质量有限的少量数据可用。因此,我们侧重于在依赖低计算资源的同时从多方面提升效率。这些改进包括神经网络设计与训练配置的修改、引入数据归一化步骤,以及一种采样更高效、失误概率更低的蒙特卡洛树搜索。在 569,537 局人类对局上训练 1.5 天后,我们达到了 60.4% 的走法预测准确率。在开发过程中,CrazyAra 的多个版本与职业人类棋手对弈。最值得注意的是,CrazyAra 以四比一战胜 2017 年疯狂象棋世界冠军 Justin Tan(又名 LM Jann Lee),其等级分比我们训练集中的平均棋手高出 400 多 Elo。此外,我们在 CPU 上测试了 CrazyAra 对阵 2017 年第二届疯狂象棋计算机锦标赛所有参赛者的对弈实力,在十三名参赛者中战胜了十二名。最后,对于 CrazyAraFish,我们在生成的引擎对局上继续训练我们的模型。在与 Stockfish 10 的十局长时间控制对局中,CrazyAraFish 十局中胜三局、平一局。

关键词

引用

@article{arxiv.1908.06660,
  title  = {Learning to play the Chess Variant Crazyhouse above World Champion Level with Deep Neural Networks and Human Data},
  author = {Johannes Czech and Moritz Willig and Alena Beyer and Kristian Kersting and Johannes Fürnkranz},
  journal= {arXiv preprint arXiv:1908.06660},
  year   = {2020}
}

备注

35 pages, 19 figures, 14 tables