用于可适应社交导航的迭代程序合成
机器人学
2021-08-31 v2 编程语言
摘要
机器人社交导航受人类偏好和特定环境场景(如电梯和门)的影响,因此需要终端用户的可适应性。社交导航的最先进方法分为两类:基于模型的社交约束和基于学习的方法。尽管有效,这些方法存在根本局限——基于模型的方法需要调整约束和参数以适应偏好和新场景,而基于学习的方法需要奖励函数、大量训练数据,并且难以适应新社交场景或仅有少量演示的新领域。在这项工作中,我们提出迭代维度知情程序合成(IDIPS),通过学习并以人类可读的符号程序形式适应社交导航,以解决这些局限。IDIPS通过结合程序合成、参数优化、谓词修复和迭代人类演示,从比基于学习的方法少几个数量级的数据中学习并适应无模型动作选择策略。我们引入一种新颖的谓词修复技术,可通过扩展现有策略来容纳先前未见的社交场景或偏好。我们给出的实验结果表明,IDIPS:1)合成建模用户偏好的有效策略,2)可使现有策略适应变化的偏好,3)可扩展策略以处理诸如上锁的门等新颖社交场景,4)生成的策略能以最小代价从仿真迁移到真实世界机器人。
引用
@article{arxiv.2103.04880,
title = {Iterative Program Synthesis for Adaptable Social Navigation},
author = {Jarrett Holtz and Simon Andrews and Arjun Guha and Joydeep Biswas},
journal= {arXiv preprint arXiv:2103.04880},
year = {2021}
}
备注
IROS 2021