中文

多策略价值蒙特卡洛树搜索

人工智能 2019-06-03 v1

摘要

许多最强的博弈程序使用蒙特卡洛树搜索(MCTS)与深度神经网络(DNN)的结合,其中 DNN 被用作策略或价值评估器。在给定有限预算(例如在线对弈或 AlphaZero(AZ)训练的自对弈阶段)的情况下,需要在准确的状态估计与更多 MCTS 模拟之间取得平衡,这两者对于强大的博弈智能体都至关重要。通常,较大的 DNN 更擅长泛化和准确评估,而较小的 DNN 成本更低,因此可在相同预算下带来更多 MCTS 模拟和更大的搜索树。本文引入一种称为多策略价值 MCTS(MPV-MCTS)的新方法,其结合多种尺寸的多个策略价值神经网络(PV-NN)以保留各网络的优点,本文中使用了两个 PV-NN f_S 和 f_L。我们通过 NoGo 游戏上的实验表明,组合的 f_S 和 f_L MPV-MCTS 优于使用单一 PV-NN 的策略价值 MCTS(称为 PV-MCTS)。此外,MPV-MCTS 在 AZ 训练中也优于 PV-MCTS。

关键词

引用

@article{arxiv.1905.13521,
  title  = {Multiple Policy Value Monte Carlo Tree Search},
  author = {Li-Cheng Lan and Wei Li and Ting-Han Wei and I-Chen Wu},
  journal= {arXiv preprint arXiv:1905.13521},
  year   = {2019}
}

备注

Proceedings of the 28th International Joint Conference on Artificial Intelligence (IJCAI-19)