中文

基于成对用户偏好的算法优化

机器人学 2023-08-10 v1 计算机视觉与模式识别 人机交互

摘要

机器人学中典型的黑盒优化方法侧重于从度量分数中学习。然而这并非总是可行,因为并非所有开发者都拥有真值。在以人为中心的环境中学习恰当的机器人行为通常需要查询用户,而用户通常无法提供精确的度量分数。现有方法利用人类反馈试图建模一个隐式奖励函数;然而,该奖励可能难以或无法被有效捕获。在本工作中,我们引入 SortCMA,以基于成对用户偏好在高维空间中优化算法参数配置。SortCMA 高效且鲁棒地利用用户输入来寻找参数集,而无需直接建模奖励。我们将该方法应用于在没有真值的情况下调谐商用深度传感器,以及涉及高度复杂机器人行为偏好的机器人社交导航。我们展示了我们的方法成功优化了用户目标,并进行了用户研究以评估社交导航结果。

关键词

引用

@article{arxiv.2308.04571,
  title  = {Optimizing Algorithms From Pairwise User Preferences},
  author = {Leonid Keselman and Katherine Shih and Martial Hebert and Aaron Steinfeld},
  journal= {arXiv preprint arXiv:2308.04571},
  year   = {2023}
}

备注

Accepted at IROS 2023