特征扩展奖励学习:重新思考人类输入
机器人学
2021-01-13 v2 人工智能
人机交互
机器学习
机器学习
摘要
当一个人对机器人执行任务的方式不满意时,他们可以进行干预以纠正它。奖励学习方法使机器人能够基于此类人类输入在线调整其奖励函数,但它们依赖于手工设计的特征。当纠正无法由这些特征解释时,深度逆强化学习(IRL)的近期工作表明,机器人可以索要任务演示并从原始状态空间中恢复一个奖励。我们的洞见是,机器人不应从演示中隐式地学习缺失的特征,而应转而索要显式地教导它缺失内容的数据。我们引入了一种新型人类输入,其中人引导机器人从被教导特征高度表达的状态走向该特征不表达的状态。我们提出了一种从原始状态空间学习该特征并将其整合进奖励函数的算法。通过将人类输入聚焦于缺失特征,我们的方法降低了样本复杂度,并改善了所学奖励相对于上述深度 IRL 基线的泛化能力。我们在一个物理 7DOF 机器人机械臂上的实验以及在一个模拟环境中进行的用户研究中展示了这一点。
引用
@article{arxiv.2006.13208,
title = {Feature Expansive Reward Learning: Rethinking Human Input},
author = {Andreea Bobu and Marius Wiggert and Claire Tomlin and Anca D. Dragan},
journal= {arXiv preprint arXiv:2006.13208},
year = {2021}
}
备注
13 pages, 14 figures