中文

ACDER:增强好奇心驱动的经验回放

机器人学 2020-11-19 v1 人工智能

摘要

在具有稀疏反馈的环境中进行探索仍是强化学习(RL)中一项具有挑战性的研究问题。当 RL 智能体随机探索环境时,会导致较低的探索效率,尤其是在具有高维连续状态与动作空间的机器人操作任务中。本文提出一种称为增强好奇心驱动经验回放(ACDER)的新方法,其利用 (i) 一种新的面向目标的 Curiosity-Driven 探索,以鼓励智能体更有目的地追求新颖且与任务相关的状态,以及 (ii) 动态初始状态选择作为一种自动探索课程,以进一步提升样本效率。我们的方法通过引入一种追求有价值状态的新方式,对 Hindsight Experience Replay(HER)形成补充。在四个具有二元奖励的挑战性机器人操作任务上进行了实验,包括 Reach、Push、Pick&Place 与 Multi-step Push。实证结果表明,我们所提方法在前三个基础任务上显著优于现有方法,并在多步机器人任务学习中也取得了令人满意的性能。

关键词

引用

@article{arxiv.2011.08027,
  title  = {ACDER: Augmented Curiosity-Driven Experience Replay},
  author = {Boyao Li and Tao Lu and Jiayi Li and Ning Lu and Yinghao Cai and Shuo Wang},
  journal= {arXiv preprint arXiv:2011.08027},
  year   = {2020}
}