中文

VLM-Social-Nav: 通过视觉语言模型评分实现社交感知机器人导航

机器人学 2024-11-27 v3

摘要

我们提出VLM-Social-Nav,一种基于视觉语言模型的新型导航方法,用于计算机器人在以人为中心的环境中的运动。我们的目标是实时决策机器人动作,使其符合人类期望的社会规范。我们利用感知模型检测重要的社会实体,并提示VLM生成符合社会规范的机器人行为指导。VLM-Social-Nav使用基于VLM的评分模块计算一个成本项,确保底层规划器生成的机器人动作既符合社会规范又有效。我们的整体方法减少了对大型训练数据集的依赖,并增强了决策的适应性。在实践中,它改善了在人机共享环境中的社会合规导航。我们在四种不同的真实世界社交导航场景中使用Turtlebot机器人演示和评估了我们的系统。我们观察到在四种社交导航场景中,平均成功率至少提高27.38%,平均碰撞率至少降低19.05%。我们的用户研究评分显示,VLM-Social-Nav生成了最符合社会规范的导航行为。

关键词

引用

@article{arxiv.2404.00210,
  title  = {VLM-Social-Nav: Socially Aware Robot Navigation through Scoring using Vision-Language Models},
  author = {Daeun Song and Jing Liang and Amirreza Payandeh and Amir Hossain Raj and Xuesu Xiao and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2404.00210},
  year   = {2024}
}