BC-IRL:从演示中学习可泛化奖励函数
机器学习
2023-03-29 v1
摘要
通过逆强化学习(IRL)学到的奖励函数泛化能力如何?我们说明,最先进的 IRL 算法(其最大化最大熵目标)学到的奖励会对演示过拟合。这类奖励难以为演示未覆盖的状态提供有意义的奖励,当使用该奖励在新情境中学习策略时,这是一个主要缺陷。我们提出 BC-IRL,一种新颖的逆强化学习方法来学习相比最大熵 IRL 方法泛化更好的奖励函数。与在演示周围最大化奖励的 MaxEnt 框架不同,BC-IRL 更新奖励参数,使得用新奖励训练的策略能更好地匹配专家演示。我们在一个说明性简单任务和两个连续机器人控制任务上表明,BC-IRL 学到的奖励泛化更好,在具有挑战性的泛化设定下达到了基线两倍以上的成功率。
引用
@article{arxiv.2303.16194,
title = {BC-IRL: Learning Generalizable Reward Functions from Demonstrations},
author = {Andrew Szot and Amy Zhang and Dhruv Batra and Zsolt Kira and Franziska Meier},
journal= {arXiv preprint arXiv:2303.16194},
year = {2023}
}