中文

物理交互即通信:从人类纠正中在线学习机器人目标

机器人学 2021-07-07 v1 机器学习 系统与控制 系统与控制

摘要

当机器人在人类旁执行任务时,物理交互不可避免:人类可能推、拉、扭或引导机器人。现有技术将这些交互视为机器人应抑制或避免的扰动。这些机器人在人类交互时至多安全响应;但在人类松手后,它们仅恢复原有行为。我们认识到,物理人机交互(pHRI)常是有意的——人类刻意介入是因为机器人未正确完成任务。本文中,我们主张当 pHRI 是有意的时,它也是信息性的:机器人可利用交互来学习即便人松手后应如何完成其当前任务的剩余部分。我们将 pHRI 形式化为一个动力系统,其中人类心中有一个期望机器人优化的目标函数,但机器人无法直接获取该目标的参数——它们内在于人类。在我们提出的框架内,人类交互成为关于真实目标的观测。我们引入近似方法以实时从 pHRI 学习并响应。我们认识到并非所有人类纠正都完美:用户常带噪声地与机器人交互,因此我们透过减少非预期学习来提升机器人从 pHRI 学习的效率。最后,我们在机械臂上进行了仿真与用户研究,将所提方法与最先进技术比较。结果表明,从 pHRI 学习可带来更好的任务表现与更高的人类满意度。

关键词

引用

@article{arxiv.2107.02349,
  title  = {Physical Interaction as Communication: Learning Robot Objectives Online from Human Corrections},
  author = {Dylan P. Losey and Andrea Bajcsy and Marcia K. O'Malley and Anca D. Dragan},
  journal= {arXiv preprint arXiv:2107.02349},
  year   = {2021}
}