中文

面向稀疏延迟奖励机器人任务的自模仿学习

机器学习 2021-05-26 v3 人工智能

摘要

强化学习(RL)在机器人控制中的应用在具有稀疏和延迟奖励的环境中仍受限制。本文提出一种实用的自模仿学习方法,称为带恒定奖励的自模仿学习(SILCR)。我们的方法不要求环境提供人工定义的即时奖励,而是根据智能体最终回合奖励,在每个时间步赋予恒定值的即时奖励。如此一来,即便环境稠密奖励不可用,智能体采取的每个动作也会得到恰当引导。我们在MuJoCo仿真中的一些具挑战性的连续机器人控制任务上验证了方法的有效性,结果显示在稀疏和延迟奖励任务中我们的方法显著优于替代方法。即便与可获得稠密奖励的替代方法相比,我们的方法也取得了有竞争力的性能。消融实验亦显示了我们方法的稳定性与可复现性。

关键词

引用

@article{arxiv.2010.06962,
  title  = {Self-Imitation Learning for Robot Tasks with Sparse and Delayed Rewards},
  author = {Zhixin Chen and Mengxiang Lin},
  journal= {arXiv preprint arXiv:2010.06962},
  year   = {2021}
}

备注

6 pages, 5 figures