面向 AlphaZero 的蒙特卡洛图搜索
人工智能
2020-12-22 v1 机器学习
摘要
AlphaZero 算法已成功应用于一系列离散领域,最著名的是棋盘游戏。它利用一个神经网络,学习价值与策略函数以在蒙特卡洛树搜索中引导探索。尽管过去已提出许多针对蒙特卡洛树搜索的改进,其中大多数指的是不使用策略进行规划的树的上置信界(Upper Confidence bounds for Trees)算法的较旧变体。我们为 AlphaZero 引入了一种新的、改进的搜索算法,其将搜索树推广为有向无环图。这使得信息能在不同子树间流动并大幅减少内存消耗。连同蒙特卡洛图搜索,我们提出了一系列进一步的扩展,例如包含 Epsilon-greedy 探索、改进的终局求解器以及将领域知识作为约束集成。在我们的评估中,以 CrazyAra 引擎在象棋与 crazyhouse 上为例,展示了这些改动为 AlphaZero 带来了显著改进。
引用
@article{arxiv.2012.11045,
title = {Monte-Carlo Graph Search for AlphaZero},
author = {Johannes Czech and Patrick Korus and Kristian Kersting},
journal= {arXiv preprint arXiv:2012.11045},
year = {2020}
}
备注
11 pages, 7 figures, 3 tables