通过主动偏好学习改进用户对机器人行为的设定:框架与评估
机器人学
2020-03-19 v2
摘要
人机交互(HRI)中的一个重要挑战是使非专家用户能够为自主机器人指定复杂任务。近来,主动偏好学习已被应用于 HRI 中以交互式地塑造机器人行为。我们研究一种框架,用户通过图形界面指定对机器人可行运动的约束,从而产生机器人任务设定。然而,用户可能无法准确评估此类约束对机器人性能的影响。因此,我们通过迭代地向用户呈现可能违反某些约束的替代方案,并从用户在替代方案之间的选择中学习约束的重要性,来修订设定。我们在一个工业设施中物料运输任务的用户研究中展示了我们的框架。我们表明,几乎所有用户都接受替代方案,从而通过学习过程获得修订后的设定,并且该修订使机器人性能得到实质性提升。此外,学习过程减小了不同用户设定之间的差异,从而使设定更为相似。结果表明,初始设定对性能影响最大的用户从交互式学习中获益最多。
引用
@article{arxiv.1907.10412,
title = {Improving User Specifications for Robot Behavior through Active Preference Learning: Framework and Evaluation},
author = {Nils Wilde and Alexandru Blidaru and Stephen L. Smith and Dana Kulić},
journal= {arXiv preprint arXiv:1907.10412},
year = {2020}
}
备注
The International Journal of Robotics Research, Mar. 2020