中文

STIR$^2$: 面向稀疏奖励任务中强化与模仿学习结合的奖励重标记方法

机器学习 2023-03-01 v2 机器人学

摘要

在寻找更具样本效率的强化学习(RL)算法的过程中,一个有前景的方向是尽可能多地利用外部离策略数据。例如专家演示。过去,人们提出了多种思路来充分利用加入回放缓冲区的演示数据,例如仅在演示上预训练或最小化额外的代价函数。我们提出了一种新方法,能够在任何稀疏奖励环境中利用演示与在线收集的回合,并兼容任意离策略算法。我们的方法基于对演示与成功回合(通过重标记)给予奖励加成,以鼓励专家模仿与自我模仿。我们的实验聚焦于两个不同仿真环境中的若干机器人操作任务。我们表明,基于奖励重标记的方法提升了基础算法(SAC 与 DDPG)在这些任务上的性能。最后,我们的最佳算法 STIR2^2(通过奖励重标记实现自我与教师模仿),将先前工作的多项改进整合进我们的方法中,比所有基线更具数据效率。

关键词

引用

@article{arxiv.2201.03834,
  title  = {STIR$^2$: Reward Relabelling for combined Reinforcement and Imitation Learning on sparse-reward tasks},
  author = {Jesus Bujalance Martin and Fabien Moutarde},
  journal= {arXiv preprint arXiv:2201.03834},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2110.14464