技能偏好:从人类反馈中学习提取与执行机器人技能
机器学习
2021-08-13 v1 机器人学
摘要
解决具挑战性的长程任务的一种有前景的方法是通过对大规模离线演示数据集拟合生成模型来提取行为先验(技能)。然而,此类生成模型继承了底层数据的偏差,在基于不完美演示数据训练时会产生糟糕且不可用的技能。为更好地使技能提取与人类意图对齐,我们提出 Skill Preferences (SkiP),一种学习人类偏好模型并用以从离线数据中提取人类对齐技能的算法。在提取人类偏好技能后,SkiP 还利用人类反馈通过 RL 解决下游任务。我们展示了 SkiP 使模拟厨房机器人能够解决复杂的多步操作任务,并大幅优于先前领先的带人类偏好的 RL 算法以及不带人类偏好的领先技能提取算法。
引用
@article{arxiv.2108.05382,
title = {Skill Preferences: Learning to Extract and Execute Robotic Skills from Human Feedback},
author = {Xiaofei Wang and Kimin Lee and Kourosh Hakhamaneshi and Pieter Abbeel and Michael Laskin},
journal= {arXiv preprint arXiv:2108.05382},
year = {2021}
}
备注
8 pages,6 figures. for associated code and video, see http://sites.google.com/view/skill-pref