通过 Bandit 人类反馈进行社交感知机器人规划
机器人学
2020-03-03 v1
摘要
在本文中,我们考虑为在人类环境中运行的机器人设计无碰撞、动态可行且社交感知的轨迹的问题。我们将轨迹定义为社交感知的,如果它们不以任何引起不适的方式干扰人类。在本文中,不适被广义地定义,并且取决于具体个体,它可能由机器人离人类太近或干扰人类视线或任务引起。此外,我们假设人类反馈是一种 bandit 反馈,指示机器人轨迹干扰人类时的抱怨或无抱怨,并且不揭示关于人类位置或抱怨原因的任何上下文信息。最后,我们假设人类可以在无障碍空间中移动,因此人类效用可能改变。我们将该规划问题表述为一个在线优化问题,最小化时变机器人轨迹的社交价值,该价值由引起的人类抱怨总数定义。由于人类效用未知,我们采用零阶或免导数优化方法来解决此问题,并将其与现成运动规划器结合以满足所得轨迹的动态可行性和无碰撞规范。据我们所知,这是一种新的社交感知机器人规划框架,不限于避免与人类碰撞,而是专注于仅使用 bandit 人类反馈来提高机器人轨迹的社交价值。
引用
@article{arxiv.2003.00658,
title = {Socially-Aware Robot Planning via Bandit Human Feedback},
author = {Xusheng Luo and Yan Zhang and Michael M. Zavlanos},
journal= {arXiv preprint arXiv:2003.00658},
year = {2020}
}
备注
10 pages, 3 figures