中文

OLiVia-Nav:一种用于移动机器人社交导航的在线终身视觉语言方法

机器人学 2025-03-11 v2

摘要

在诸如医院、办公楼和长期护理院等以人为中心的环境中的服务机器人,需要在遵守社会规范的同时进行导航,以确保与其共享空间的人们感到安全和舒适。此外,它们还需要适应机器人导航过程中可能出现的新社交场景。在本文中,我们提出了一种新颖的在线终身视觉语言架构 OLiVia-Nav,它独特地将视觉语言模型 (VLM) 与用于机器人社交导航的在线终身学习框架相结合。我们引入了一种独特的蒸馏方法,即社交上下文对比语言-图像预训练 (SC-CLIP),将大型 VLM 的社交推理能力迁移到轻量级 VLM,以使 OLiVia-Nav 能够在机器人导航期间直接编码社交和环境上下文。这些编码的嵌入用于生成和选择机器人符合社交规范的轨迹。SC-CLIP 的终身学习能力使 OLiVia-Nav 能够在遇到新的社交场景时随时间更新机器人轨迹规划。我们在不同的社交导航场景中进行了广泛的真实世界实验。结果表明,在均方误差、Hausdorff 损失和个人空间侵犯持续时间方面,OLiVia-Nav 优于现有的最先进的 DRL 和 VLM 方法。消融研究也验证了 OLiVia-Nav 的设计选择。

关键词

引用

@article{arxiv.2409.13675,
  title  = {OLiVia-Nav: An Online Lifelong Vision Language Approach for Mobile Robot Social Navigation},
  author = {Siddarth Narasimhan and Aaron Hao Tan and Daniel Choi and Goldie Nejat},
  journal= {arXiv preprint arXiv:2409.13675},
  year   = {2025}
}