通过融合人类示范与偏好学习奖励函数
机器人学
2019-06-24 v1 人工智能
摘要
我们的目标是准确且高效地学习自主机器人的奖励函数。当前解决该问题的方法包括逆强化学习(IRL,利用专家示范)和基于偏好的学习(迭代地询问用户对轨迹之间的偏好)。然而在机器人领域,IRL 常常陷入困境,因为难以获得高质量的示范;反之,基于偏好的学习效率很低,因为它试图从二元反馈中学习一个连续的、高维的函数。我们提出了一种新的奖励学习框架 DemPref,它同时利用示范和偏好查询来学习奖励函数。具体而言,我们(1)利用示范在奖励函数空间上学习一个粗略的先验,以减小生成查询的空间的有效规模;(2)利用示范来锚定(主动)查询生成过程,以提高所生成查询的质量。我们的方法缓解了标准基于偏好的学习方法所面临的效率问题,并且不单纯依赖于(可能低质量的)示范。在数值实验中,我们发现 DemPref 比标准的主动基于偏好的学习方法显著更高效。在一项用户研究中,我们将我们的方法与标准 IRL 方法进行比较;我们发现用户认为用 DemPref 训练的机器人在学习其期望行为方面更成功,并且更倾向于使用 DemPref 系统(而非 IRL)来训练机器人。
引用
@article{arxiv.1906.08928,
title = {Learning Reward Functions by Integrating Human Demonstrations and Preferences},
author = {Malayandi Palan and Nicholas C. Landolfi and Gleb Shevchuk and Dorsa Sadigh},
journal= {arXiv preprint arXiv:1906.08928},
year = {2019}
}
备注
Presented at RSS 2019