PBCS:利用强化学习与运动规划协同的高效探索与利用
机器人学
2022-06-10 v1 人工智能
机器学习
机器学习
摘要
探索-利用权衡是强化学习(RL)的核心。然而,近期 RL 研究中使用的大多数连续控制基准仅需要局部探索。这导致开发的算法具备基础探索能力,在需要更多样化探索的基准中表现不佳。例如,如我们的实证研究所示,最先进的 RL 算法如 DDPG 和 TD3 甚至无法在小型 2D 迷宫中操控一个点质量。本文中,我们提出一种称为“规划、回溯播放、链式技能”(PBCS)的新算法,结合运动规划和强化学习来解决困难探索环境。在第一阶段,使用运动规划算法找到一条良好轨迹,然后通过结合 Backplay 算法的一个变体和技能链,利用从轨迹导出的课程训练 RL 算法。我们表明该方法在各种尺寸的 2D 迷宫环境中优于最先进的 RL 算法,并能够改进运动规划阶段获得的轨迹。
引用
@article{arxiv.2004.11667,
title = {PBCS : Efficient Exploration and Exploitation Using a Synergy between Reinforcement Learning and Motion Planning},
author = {Guillaume Matheron and Nicolas Perrin and Olivier Sigaud},
journal= {arXiv preprint arXiv:2004.11667},
year = {2022}
}