AlphaZero 类深度强化学习中的自适应热启动 MCTS
人工智能
2021-05-14 v1 机器学习
摘要
AlphaZero 通过结合自对弈中搜索与神经网络训练的架构,在深度强化学习中取得了令人瞩目的性能。许多研究者正寻求在其他游戏/任务中复现并改进其结果。然而,该架构被设计为从零开始、白板(tabula rasa)学习,接受了自对弈中的冷启动问题。近来,一种面向蒙特卡洛树搜索(Monte Carlo Tree Search)的热启动增强方法被提出,以改善自对弈起始阶段,其采用固定参数 控制热启动长度,并在小型棋盘游戏中报告了性能提升。本文给出一种自适应切换方法的结果。实验表明,我们的方法优于固定 ,尤其在“深层”、策略性游戏(黑白棋与四子棋)中。我们推测 的自适应取值亦受游戏规模影响,且平均而言 随游戏规模增大而增大。我们得出结论:AlphaZero 类深度强化学习受益于基于自适应 rollout 的热启动,正如 Rapid Action Value Estimate 在 15 年前对基于 rollout 的强化学习之所为。
引用
@article{arxiv.2105.06136,
title = {Adaptive Warm-Start MCTS in AlphaZero-like Deep Reinforcement Learning},
author = {Hui Wang and Mike Preuss and Aske Plaat},
journal= {arXiv preprint arXiv:2105.06136},
year = {2021}
}