策略梯度搜索:无搜索树的在线规划与专家迭代
机器学习
2019-04-09 v1 机器学习
摘要
蒙特卡洛树搜索(MCTS)算法执行基于模拟的搜索以在线改进策略。在搜索过程中,模拟策略被调整以探索最有前景的行棋路线。MCTS 已被最先进的程序用于许多问题,然而 MCTS 的一个缺点是它用存储在搜索树中的蒙特卡洛平均来估计状态值;这无法扩展到具有极高分支因子的游戏。我们提出一种替代的基于模拟的搜索方法——策略梯度搜索(PGS),它通过策略梯度更新在线调整神经网络模拟策略,从而避免了对搜索树的需求。在六子棋(Hex)中,PGS 取得了与 MCTS 相当的性能,并且使用基于 PGS 的专家迭代(Expert Iteration)训练的智能体能够在 9x9 六子棋中击败最强的开源六子棋智能体 MoHex 2.0。
引用
@article{arxiv.1904.03646,
title = {Policy Gradient Search: Online Planning and Expert Iteration without Search Trees},
author = {Thomas Anthony and Robert Nishihara and Philipp Moritz and Tim Salimans and John Schulman},
journal= {arXiv preprint arXiv:1904.03646},
year = {2019}
}