中文

后见之明经验回放 (Hindsight Experience Replay)

机器学习 2018-02-26 v3 人工智能 神经与进化计算 机器人学

摘要

处理稀疏奖励是强化学习 (Reinforcement Learning, RL) 中最大的挑战之一。我们提出了一种称为后见之明经验回放 (Hindsight Experience Replay) 的新技术,它允许从稀疏且二元的奖励中进行样本高效的学习,从而避免了复杂奖励工程的需要。它可以与任意离策略 (off-policy) RL 算法结合,并可视为一种隐式课程的形式。我们在机械臂操作物体的任务上演示了我们的方法。特别地,我们在三个不同的任务上运行实验:推、滑和拾取-放置 (pick-and-place),在每种情况下仅使用指示任务是否完成的二元奖励。我们的消融研究表明,Hindsight Experience Replay 是在这些具有挑战性的环境中使训练成为可能的关键要素。我们展示了在物理仿真上训练的策略可以部署在实体机器人上并成功完成任务。

关键词

引用

@article{arxiv.1707.01495,
  title  = {Hindsight Experience Replay},
  author = {Marcin Andrychowicz and Filip Wolski and Alex Ray and Jonas Schneider and Rachel Fong and Peter Welinder and Bob McGrew and Josh Tobin and Pieter Abbeel and Wojciech Zaremba},
  journal= {arXiv preprint arXiv:1707.01495},
  year   = {2018}
}