中文

利用 SACR2 从演示中学习:带奖励重标的软 actor-critic

机器学习 2021-12-06 v2 机器人学

摘要

近年来,深度强化学习(DRL)已成功进入机器人、自动驾驶或视频游戏等复杂决策应用。离策略算法往往比同策略算法更具样本效率,并且还能受益于回放缓冲区中存储的任何离策略数据。专家演示是此类数据的一种流行来源:智能体早期接触到成功的状态与动作,可加速学习过程并提升性能。过去,人们提出了多种想法以充分利用缓冲区中的演示,例如仅在演示上预训练或最小化额外代价函数。我们开展了一项研究,孤立地评估其中若干想法,以观察哪些影响最为显著。我们还提出了一种针对稀疏奖励任务的新方法,基于对演示和成功回合给予奖励加成。首先,我们对来自演示的转移给予奖励加成,以鼓励智能体匹配所演示的行为。然后,在收集到成功回合后,我们在将其转移加入回放缓冲区前用相同加成重新标注,鼓励智能体也匹配其先前的成功。我们实验的基础算法是流行的 Soft Actor-Critic(SAC),一种用于连续动作空间的先进离策略算法。我们的实验聚焦于操纵机器人,具体为仿真中机械臂的三维到达任务。我们表明,即便在没有演示的情况下,我们基于奖励重标的方法 SACR2 也提升了该任务的性能。

关键词

引用

@article{arxiv.2110.14464,
  title  = {Learning from demonstrations with SACR2: Soft Actor-Critic with Reward Relabeling},
  author = {Jesus Bujalance Martin and Raphael Chekroun and Fabien Moutarde},
  journal= {arXiv preprint arXiv:2110.14464},
  year   = {2021}
}

备注

Presented at Deep RL Workshop, NeurIPS 2021