基于演示的分层强化学习中的遗忘式经验回放
机器学习
2020-06-18 v1 人工智能
摘要
目前,深度强化学习(RL)在复杂的游戏和机器人环境中展现出令人印象深刻的成果。这些成果往往以巨大的计算成本为代价,并且需要智能体与环境之间进行难以置信的大量交互回合。提升强化学习方法样本效率主要有两种途径——使用分层方法和专家演示。在本文中,我们提出了这两种方法的结合,使智能体能够在具有多个相关目标的复杂基于视觉的环境中使用低质量演示。我们的遗忘式经验回放(ForgER)算法有效处理专家数据中的错误,并在将动作空间和状态表示适配到智能体能力时减少质量损失。我们提出的面向目标回放缓冲区结构使智能体能够自动从演示中突出子目标以求解复杂的分层任务。我们的方法是通用的,可集成到各种离策略方法中。它在各类模型环境中超越了所有已知的现有使用专家演示的SOTA RL方法。基于我们算法的解决方案击败了著名的MineRL竞赛的所有方案,并使智能体能够在Minecraft环境中开采出钻石。
引用
@article{arxiv.2006.09939,
title = {Forgetful Experience Replay in Hierarchical Reinforcement Learning from Demonstrations},
author = {Alexey Skrynnik and Aleksey Staroverov and Ermek Aitygulov and Kirill Aksenov and Vasilii Davydov and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2006.09939},
year = {2020}
}