中文

在异步深度强化学习中使用蒙特卡洛树搜索作为示范者

机器学习 2018-12-04 v1 人工智能 神经与进化计算

摘要

近年来,在新型方法和更高算力的帮助下,深度强化学习(DRL)取得了巨大成功。然而,仍存在若干挑战有待解决,例如收敛到局部最优策略以及训练时间长。在本文中,首先,我们通过一种新颖的自监督辅助任务,即衡量到终止状态时间接近度的\emph{终止预测}(Terminal Prediction),来增强异步优势演员-评论家(A3C)方法,即 A3C-TP。其次,我们提出一个新框架,其中规划算法(如蒙特卡洛树搜索)或其他(模拟)示范者来源可以集成到异步分布式 DRL 方法中。与原始 A3C 相比,我们提出的方法在 Pommerman 游戏的双人迷你版本上都学习更快并收敛到更好的策略。

关键词

引用

@article{arxiv.1812.00045,
  title  = {Using Monte Carlo Tree Search as a Demonstrator within Asynchronous Deep RL},
  author = {Bilal Kartal and Pablo Hernandez-Leal and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:1812.00045},
  year   = {2018}
}

备注

9 pages, 6 figures, To appear at AAAI-19 Workshop on Reinforcement Learning in Games