中文

面向人在回路强化学习的少样本偏好学习

机器人学 2022-12-08 v1 人工智能 机器学习

摘要

尽管强化学习(RL)已成为机器人领域更受欢迎的方法,但为复杂任务设计信息充分的奖励函数已被证明极其困难,因其无法捕捉人类意图且存在策略利用问题。基于偏好的 RL 算法力求通过直接从人类反馈中学习奖励函数克服这些挑战。遗憾的是,先前工作要么需要不合理数量的查询(任何人类都无法回答),要么过度限制奖励函数类别以保证引出最具信息量的查询,导致模型对现实机器人任务表达不足。与多数聚焦于查询选择以\emph{最小化}学习奖励函数所需数据量的工作相反,我们采取相反路径:通过以更灵活的多任务学习视角看待人在回路 RL,\emph{扩展}可用数据池。受元学习成功启发,我们在先前任务数据上预训练偏好模型,并仅使用少量查询为新任务快速适配。实证上,我们将在 Meta-World 中训练操控策略所需的在线反馈量减少 20×\times,并在真实的 Franka Panda 机器人上展示了方法的有效性。此外,查询复杂度的这一降低使我们能够从真实人类用户处训练机器人策略。我们的结果视频与代码可在 https://sites.google.com/view/few-shot-preference-rl/home 找到。

关键词

引用

@article{arxiv.2212.03363,
  title  = {Few-Shot Preference Learning for Human-in-the-Loop RL},
  author = {Joey Hejna and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2212.03363},
  year   = {2022}
}

备注

6th Annual Conference on Robot Learning (CoRL) 2022