利用策略梯度与MCTS价值估计从自我对弈中学习策略
机器学习
2019-05-16 v1 人工智能
机器学习
摘要
近年来,最先进的博弈智能体通常涉及在自我对弈过程中训练的策略,其中蒙特卡洛树搜索(MCTS)算法与训练策略迭代地相互提升。当策略通过最小化交叉熵损失来模仿MCTS的搜索行为时,取得了最强的结果。由于MCTS在设计上包含探索成分,以此方式训练的策略也可能表现出相似程度的探索。在本文中,我们致力于为一个未来目标包括提取可解释策略而非追求最先进博弈性能的项目学习策略。针对这些目标,我们认为此类程度的探索是不可取的,并提出了一种用于训练非探索性策略的新目标函数。我们推导了最大化该目标函数的策略梯度表达式,其可利用MCTS价值估计而非MCTS访问计数进行估计。我们在多种棋盘游戏中经验性地评估了所得策略的各种性质。
引用
@article{arxiv.1905.05809,
title = {Learning Policies from Self-Play with Policy Gradients and MCTS Value Estimates},
author = {Dennis J. N. J. Soemers and Éric Piette and Matthew Stephenson and Cameron Browne},
journal= {arXiv preprint arXiv:1905.05809},
year = {2019}
}
备注
Accepted at the IEEE Conference on Games (CoG) 2019