中文

基于启发式、蒙特卡洛树搜索与深度强化学习理解跳棋

机器学习 2019-03-11 v2 机器学习

摘要

跳棋是一种具有挑战性的传统完备信息棋类游戏,与其他传统游戏在两个主要方面有所不同:首先,与象棋不同,所有棋子永久留于盘中,因此搜索树的分支因子不会随对局推进而减小;其次,与围棋不同,由于允许重复与后退走子,搜索树深度亦无上限。因此,即便在受限对局实例中,游戏的状态空间仍可能无界,使计算机程序难以精通。本工作中,我们提出一种无需任何人类对局数据、有效结合启发式、蒙特卡洛树搜索与深度强化学习来构建跳棋智能体的方法。实验结果表明,我们的智能体在不同场景下均表现胜任,并达到经验丰富的人类玩家水平。

关键词

引用

@article{arxiv.1903.01747,
  title  = {Towards Understanding Chinese Checkers with Heuristics, Monte Carlo Tree Search, and Deep Reinforcement Learning},
  author = {Ziyu Liu and Meng Zhou and Weiqing Cao and Qiang Qu and Henry Wing Fung Yeung and Vera Yuk Ying Chung},
  journal= {arXiv preprint arXiv:1903.01747},
  year   = {2019}
}