中文

人类在环机器人规划与非上下文_bandit反馈

光学 2020-11-11 v1 应用物理

摘要

在本文中,我们考虑在有人群的环境中机器人导航问题。目标是确定无碰撞且动态可行的轨迹,同时最大化人类满意度。这是因为它们可能将机器人驱动到需要工作帮助的人类附近,或者因为它们可能在机器人干扰人类视线或工作时使其远离人类。实际上,人类满意度是主观的且难以用数学描述。因此,我们在本文中考虑的规划问题可能缺乏重要的上下文信息。为应对这一挑战,我们提出一种半监督贝叶斯优化(BO)方法,利用非上下文 bandit 人类反馈(以抱怨或满意度评分的形式表达一条轨迹的满意程度,而不揭示原因)来设计全局最优机器人轨迹。由于轨迹规划通常是在定义轨迹的路点空间中的高维优化问题,BO 可能需要过多的人类反馈查询才能返回良好解。为此,我们使用自动编码器将高维问题空间降维至低维潜空间,并利用人类反馈更新该空间。此外,我们通过将新轨迹的搜索偏向使用现成运动规划器获得的动态可行且无碰撞轨迹,来提高 BO 的探索效率。我们在具有多样化且未知需求人类的场景中展示了我们所提轨迹规划方法的效率。

关键词

引用

@article{arxiv.2011.01792,
  title  = {Surface acoustic wave photonic devices in silicon on insulator},
  author = {Dvir Munk and Moshe Katzman and Mirit Hen and Maayan Priel and Moshe Feldberg and Tali Sharabani and Shahar Levy and Arik Bergman and Avi Zadok},
  journal= {arXiv preprint arXiv:2011.01792},
  year   = {2020}
}