中文

将人类对机器人行为的偏好学习为软规划约束

机器人学 2024-04-01 v1

摘要

为了使机器人行为适应特定用户的需求和期望,偏好学习在人机交互(HRI)领域早已被研究。通常,人类偏好被建模为标量函数;然而,这种表述混淆了关于机器人执行给定任务时应如何行为的关键考量与期望但非必需的机器人行为。在本工作中,我们利用规划框架来区分这种必需与期望的机器人行为。具体而言,我们提出了一种新的 HRI 偏好学习问题表述,将各种类型的人类偏好编码为软规划约束。然后,我们探索了一种数据驱动的方法,使机器人能够通过查询用户来推断偏好,并在 Habitat 2.0 模拟器的重排任务中进行了实例化。我们表明,即使在模拟用户在潜在机器人行为之间进行选择时存在不同噪声水平的情况下,所提出的方法在推断三种类型的偏好方面也展现出良好前景。我们的贡献为未来基于可适应规划的机器人行为开辟了道路。

关键词

引用

@article{arxiv.2403.19795,
  title  = {Learning Human Preferences Over Robot Behavior as Soft Planning Constraints},
  author = {Austin Narcomey and Nathan Tsoi and Ruta Desai and Marynel Vázquez},
  journal= {arXiv preprint arXiv:2403.19795},
  year   = {2024}
}