基于 MCTS 动作引导的深度强化学习
机器学习
2019-07-30 v1 多智能体系统
机器学习
摘要
深度强化学习近年来取得巨大成功,然而一个主要挑战是样本低效。本文关注如何在具有稀疏、延迟且可能具欺骗性奖励的领域——近期提出的多智能体基准 Pommerman——中,利用非专家示范者的动作引导来提升样本效率。我们提出一种新框架,其中即便非专家模拟示范者,例如具有少量 rollout 的蒙特卡洛树搜索等规划算法,也可被集成于异步分布式深度强化学习方法内。与朴素深度 RL 算法相比,我们提出的方法在 Pommerman 游戏的双人迷你版本上既学习更快,又收敛到更优策略。
引用
@article{arxiv.1907.11703,
title = {Action Guidance with MCTS for Deep Reinforcement Learning},
author = {Bilal Kartal and Pablo Hernandez-Leal and Matthew E. Taylor},
journal= {arXiv preprint arXiv:1907.11703},
year = {2019}
}
备注
AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE'19). arXiv admin note: substantial text overlap with arXiv:1904.05759, arXiv:1812.00045