中文

面向 AlphaZero 的蒙特卡洛图搜索

人工智能 2020-12-22 v1 机器学习

摘要

AlphaZero 算法已成功应用于一系列离散领域,最著名的是棋盘游戏。它利用一个神经网络,学习价值与策略函数以在蒙特卡洛树搜索中引导探索。尽管过去已提出许多针对蒙特卡洛树搜索的改进,其中大多数指的是不使用策略进行规划的树的上置信界(Upper Confidence bounds for Trees)算法的较旧变体。我们为 AlphaZero 引入了一种新的、改进的搜索算法,其将搜索树推广为有向无环图。这使得信息能在不同子树间流动并大幅减少内存消耗。连同蒙特卡洛图搜索,我们提出了一系列进一步的扩展,例如包含 Epsilon-greedy 探索、改进的终局求解器以及将领域知识作为约束集成。在我们的评估中,以 CrazyAra 引擎在象棋与 crazyhouse 上为例,展示了这些改动为 AlphaZero 带来了显著改进。

关键词

引用

@article{arxiv.2012.11045,
  title  = {Monte-Carlo Graph Search for AlphaZero},
  author = {Johannes Czech and Patrick Korus and Kristian Kersting},
  journal= {arXiv preprint arXiv:2012.11045},
  year   = {2020}
}

备注

11 pages, 7 figures, 3 tables