从人类示范中联合估计专业水平与奖励偏好
机器人学
2020-11-10 v1
摘要
当机器人从人类示例中学习时,大多数方法假设人类伙伴提供的是最优行为的示例。然而,在一些应用中,机器人从非专家人类处学习。我们认为机器人不仅应学习人类的目标,还应学习其专业水平。机器人随后可利用这一联合信息来降低或增加向其人类伙伴提供协助的频率,或在向新手用户学习新技能时更加谨慎。类似地,通过考虑人类的专业水平,机器人还能够推断人类的真实目标,即使人类因缺乏专业知识而未能恰当地展示这些目标。在本文中,我们提出在给定人类(可能)非最优示范的观察下,联合推断人类的专业水平与目标函数。提出了两种推断方法。在第一种方法中,推断是在有限的、离散的可能目标函数与专业水平集合上进行的。在第二种方法中,机器人在所有假设空间上优化,并找到最能解释所观察人类行为的目标函数与专业水平。我们在仿真中与真实用户数据上均展示了所提出的方法。
引用
@article{arxiv.2011.04118,
title = {Joint Estimation of Expertise and Reward Preferences From Human Demonstrations},
author = {Pamela Carreno-Medrano and Stephen L. Smith and Dana Kulic},
journal= {arXiv preprint arXiv:2011.04118},
year = {2020}
}
备注
17 pages, TRO Submission