基于成对用户偏好的算法优化
机器人学
2023-08-10 v1 计算机视觉与模式识别
人机交互
摘要
机器人学中典型的黑盒优化方法侧重于从度量分数中学习。然而这并非总是可行,因为并非所有开发者都拥有真值。在以人为中心的环境中学习恰当的机器人行为通常需要查询用户,而用户通常无法提供精确的度量分数。现有方法利用人类反馈试图建模一个隐式奖励函数;然而,该奖励可能难以或无法被有效捕获。在本工作中,我们引入 SortCMA,以基于成对用户偏好在高维空间中优化算法参数配置。SortCMA 高效且鲁棒地利用用户输入来寻找参数集,而无需直接建模奖励。我们将该方法应用于在没有真值的情况下调谐商用深度传感器,以及涉及高度复杂机器人行为偏好的机器人社交导航。我们展示了我们的方法成功优化了用户目标,并进行了用户研究以评估社交导航结果。
引用
@article{arxiv.2308.04571,
title = {Optimizing Algorithms From Pairwise User Preferences},
author = {Leonid Keselman and Katherine Shih and Martial Hebert and Aaron Steinfeld},
journal= {arXiv preprint arXiv:2308.04571},
year = {2023}
}
备注
Accepted at IROS 2023