中文

从物理人类反馈中学习:一种以对象为中心的单次自适应方法

机器人学 2023-06-05 v2 人工智能 人机交互 机器学习

摘要

为了使机器人能够有效地部署到新环境和任务中,它们必须能够理解人类在干预期间表达的反馈。这可以纠正不受欢迎的行为或表明额外的偏好。现有方法要么需要重复的交互回合,要么假设预先已知奖励特征,这导致数据效率低下且难以迁移到新任务。我们通过以对象为中心的子任务来描述人类任务,并根据特定对象解释物理干预,从而放宽了这些假设。我们的方法,对象偏好自适应(OPA),由两个关键阶段组成:1)预训练一个基础策略以产生广泛的行为,以及 2)根据人类反馈进行在线更新。我们快速而简单的自适应的关键在于,智能体与对象之间的一般交互动态是固定的,仅更新特定于对象的偏好。我们的自适应在线进行,仅需一次人类干预(单次),并产生训练期间从未见过的新行为。我们的策略在廉价的合成数据而非昂贵的人类演示上进行训练,能够在物理 7DOF 机器人的现实任务中正确适应人类的扰动。提供了视频、代码和补充材料。

关键词

引用

@article{arxiv.2203.04951,
  title  = {Learning from Physical Human Feedback: An Object-Centric One-Shot Adaptation Method},
  author = {Alvin Shek and Bo Ying Su and Rui Chen and Changliu Liu},
  journal= {arXiv preprint arXiv:2203.04951},
  year   = {2023}
}

备注

Accepted to ICRA 2023