中文

基于自动排序示范的超越示范者模仿学习

机器学习 2019-10-15 v3 机器学习

摘要

模仿学习的性能通常以上界受限于示范者的性能。尽管近期实证结果表明排序示范可实现超越示范者的性能,但对示范的偏好可能难以获取,且理论上鲜有已知此类方法何时能成功外推至示范者性能之外。为解决这些问题,我们首先给出超越示范者模仿学习的充分条件,并提供理论结果说明为何在对示范的偏好进行逆强化学习时能更好地降低奖励函数歧义。基于该理论,我们引入基于扰动的奖励外推(D-REX),一种基于排序的模仿学习方法,其向通过行为克隆学到的策略中注入噪声以自动生成排序示范。这些排序示范被用于高效学习奖励函数,随后可通过强化学习优化。我们在模拟机器人与 Atari 模仿学习基准上实证验证我们的方法,并表明 D-REX 优于标准模仿学习方法且能显著超越示范者性能。D-REX 是首个在无额外侧信息或监督(如奖励或人类偏好)下实现显著超越示范者性能外推的模仿学习方法。通过自动生成排序,我们展示了基于偏好的逆强化学习可应用于仅有未标注示范可用的传统模仿学习设定中。

关键词

引用

@article{arxiv.1907.03976,
  title  = {Better-than-Demonstrator Imitation Learning via Automatically-Ranked Demonstrations},
  author = {Daniel S. Brown and Wonjoon Goo and Scott Niekum},
  journal= {arXiv preprint arXiv:1907.03976},
  year   = {2019}
}

备注

In proceedings of 3rd Conference on Robot Learning (CoRL) 2019