学会停止:动态模拟蒙特卡洛树搜索
人工智能
2020-12-16 v1 机器学习
摘要
蒙特卡洛树搜索(MCTS)在与深度神经网络(DNN)结合后,在围棋和雅达利游戏等诸多领域取得了最先进的结果。执行更多模拟时,MCTS 可以达到更高性能,但也需要耗费大量的 CPU 和 GPU 资源。然而,并非所有状态都需要长时间的搜索才能确定智能体可找到的最佳动作。例如,在 19x19 围棋和 NoGo 中,我们发现超过一半的状态,即使搜索 2 分钟后,DNN 预测的最佳动作仍保持不变。这意味着,如果我们能在对当前搜索结果有信心时提前停止搜索,就可以节省大量资源。在本文中,我们提出通过预测当前搜索状态的不确定性,并利用该结果决定是否应停止搜索来实现这一目标。通过我们称为动态模拟 MCTS(DS-MCTS)的算法,我们能将 AlphaZero 训练的 NoGo 智能体加速 2.5 倍,同时保持相似的胜率。此外,在相同平均模拟次数下,我们的方法对原始程序可达到 61% 的胜率。
引用
@article{arxiv.2012.07910,
title = {Learning to Stop: Dynamic Simulation Monte-Carlo Tree Search},
author = {Li-Cheng Lan and Meng-Yu Tsai and Ti-Rong Wu and I-Chen Wu and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2012.07910},
year = {2020}
}
备注
Proceedings of the Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-21)