中文

策略梯度搜索:无搜索树的在线规划与专家迭代

机器学习 2019-04-09 v1 机器学习

摘要

蒙特卡洛树搜索(MCTS)算法执行基于模拟的搜索以在线改进策略。在搜索过程中,模拟策略被调整以探索最有前景的行棋路线。MCTS 已被最先进的程序用于许多问题,然而 MCTS 的一个缺点是它用存储在搜索树中的蒙特卡洛平均来估计状态值;这无法扩展到具有极高分支因子的游戏。我们提出一种替代的基于模拟的搜索方法——策略梯度搜索(PGS),它通过策略梯度更新在线调整神经网络模拟策略,从而避免了对搜索树的需求。在六子棋(Hex)中,PGS 取得了与 MCTS 相当的性能,并且使用基于 PGS 的专家迭代(Expert Iteration)训练的智能体能够在 9x9 六子棋中击败最强的开源六子棋智能体 MoHex 2.0。

关键词

引用

@article{arxiv.1904.03646,
  title  = {Policy Gradient Search: Online Planning and Expert Iteration without Search Trees},
  author = {Thomas Anthony and Robert Nishihara and Philipp Moritz and Tim Salimans and John Schulman},
  journal= {arXiv preprint arXiv:1904.03646},
  year   = {2019}
}