中文

基于 MCTS 动作引导的深度强化学习

机器学习 2019-07-30 v1 多智能体系统 机器学习

摘要

深度强化学习近年来取得巨大成功,然而一个主要挑战是样本低效。本文关注如何在具有稀疏、延迟且可能具欺骗性奖励的领域——近期提出的多智能体基准 Pommerman——中,利用非专家示范者的动作引导来提升样本效率。我们提出一种新框架,其中即便非专家模拟示范者,例如具有少量 rollout 的蒙特卡洛树搜索等规划算法,也可被集成于异步分布式深度强化学习方法内。与朴素深度 RL 算法相比,我们提出的方法在 Pommerman 游戏的双人迷你版本上既学习更快,又收敛到更优策略。

关键词

引用

@article{arxiv.1907.11703,
  title  = {Action Guidance with MCTS for Deep Reinforcement Learning},
  author = {Bilal Kartal and Pablo Hernandez-Leal and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:1907.11703},
  year   = {2019}
}

备注

AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE'19). arXiv admin note: substantial text overlap with arXiv:1904.05759, arXiv:1812.00045