在异步深度强化学习中使用蒙特卡洛树搜索作为示范者
机器学习
2018-12-04 v1 人工智能
神经与进化计算
摘要
近年来,在新型方法和更高算力的帮助下,深度强化学习(DRL)取得了巨大成功。然而,仍存在若干挑战有待解决,例如收敛到局部最优策略以及训练时间长。在本文中,首先,我们通过一种新颖的自监督辅助任务,即衡量到终止状态时间接近度的\emph{终止预测}(Terminal Prediction),来增强异步优势演员-评论家(A3C)方法,即 A3C-TP。其次,我们提出一个新框架,其中规划算法(如蒙特卡洛树搜索)或其他(模拟)示范者来源可以集成到异步分布式 DRL 方法中。与原始 A3C 相比,我们提出的方法在 Pommerman 游戏的双人迷你版本上都学习更快并收敛到更好的策略。
引用
@article{arxiv.1812.00045,
title = {Using Monte Carlo Tree Search as a Demonstrator within Asynchronous Deep RL},
author = {Bilal Kartal and Pablo Hernandez-Leal and Matthew E. Taylor},
journal= {arXiv preprint arXiv:1812.00045},
year = {2018}
}
备注
9 pages, 6 figures, To appear at AAAI-19 Workshop on Reinforcement Learning in Games