中文

基于蒙特卡洛树搜索策略迭代的单智能体优化

机器学习 2020-05-26 v1 人工智能

摘要

Monte-Carlo Tree Search (MCTS) 与深度强化学习的结合在双人完全信息博弈中处于 state-of-the-art 水平。在本文中,我们描述了一种使用 MCTS 变体的搜索算法,我们通过以下方式对其进行了增强:1)一种针对具有潜在无界奖励游戏(这在许多优化问题中是常见情况)的新型动作价值归一化机制,2)定义了能够实现有效搜索并行化的虚拟损失函数,以及 3)通过多代自我博弈训练的策略网络来指导搜索。我们在“SameGame”——一个流行的单人测试域中——评估了我们方法的有效性。我们的实验结果表明,我们的方法在多种棋盘尺寸上优于基线算法。此外,在公开的棋局集合上,它与 state-of-the-art 搜索算法具有竞争力。

关键词

引用

@article{arxiv.2005.11335,
  title  = {Single-Agent Optimization Through Policy Iteration Using Monte-Carlo Tree Search},
  author = {Arta Seify and Michael Buro},
  journal= {arXiv preprint arXiv:2005.11335},
  year   = {2020}
}

备注

Poster presentation at RL in Games Workshop, AAAI 2020