中文

从多样人类反馈源学习奖励函数:演示与偏好的最优融合

机器人学 2021-08-05 v2 人工智能 机器学习

摘要

奖励函数是规定机器人目标的常用方式。由于设计奖励函数极具挑战,更有前景的途径是直接从人类教师处学习奖励函数。重要的是,人类教师的数据可被动或主动地以多种形式收集:被动数据源包括演示(如示教引导),而偏好(如比较排序)则是主动征询的。已有研究将这些不同数据源独立地应用于奖励学习。然而,在许多领域中多种数据源是互补且具表现力的。受这一普遍问题驱动,我们提出一个融合多源信息的框架,这些信息或被动或主动地从人类用户处收集。具体而言,我们给出一种算法,首先利用用户演示初始化关于奖励函数的信念,随后通过偏好查询主动探查用户以锁定其真实奖励。该算法不仅使我们能结合多种数据源,还告知机器何时应当利用哪类信息。此外,我们的方法考量了人类提供数据的能力: yielding 用户友好的偏好查询,且在理论上是最优的。我们在 Fetch 移动操作臂上的大量仿真实验与用户研究证明了该融合框架的优越性与易用性。

关键词

引用

@article{arxiv.2006.14091,
  title  = {Learning Reward Functions from Diverse Sources of Human Feedback: Optimally Integrating Demonstrations and Preferences},
  author = {Erdem Bıyık and Dylan P. Losey and Malayandi Palan and Nicholas C. Landolfi and Gleb Shevchuk and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2006.14091},
  year   = {2021}
}

备注

20 pages, 17 figures. Accepted for publication by The International Journal of Robotics Research (IJRR)