中文

CoNVOI:使用视觉语言模型在室内外环境中进行上下文感知导航

机器人学 2024-03-26 v1

摘要

我们提出了ConVOI,一种使用视觉语言模型(VLM)在真实室内外环境中进行自主机器人导航的新方法。我们以两种方式使用VLM:首先,利用其零样本图像分类能力识别机器人周围环境的上下文或场景(例如室内走廊、户外地形、人行横道等),并将基于上下文的导航行为制定为简单的文本提示(例如“留在人行道上”)。其次,利用其最先进的语义理解和逻辑推理能力,根据识别的上下文计算合适的轨迹。为此,我们提出了一种新颖的多模态视觉标记方法,通过将RGB图像与环境的局部占用图相关联,用数字标记图像中无障碍区域。标记的数字将图像位置锚定在真实世界中,将VLM的注意力仅引导到可导航位置,并阐明它们与图像中描绘的地形之间的空间关系。然后,我们查询VLM以选择标记图像上满足基于上下文行为文本提示的数字,并使用选定的数字构建参考路径。最后,我们提出了一种方法,当机器人的环境上下文未发生变化时,外推参考轨迹以避免不必要的VLM查询。我们使用参考轨迹引导运动规划器,并证明它在各种真实室内外场景中导致了类似人类的行为(例如不穿过人群、使用人行横道等)。

关键词

引用

@article{arxiv.2403.15637,
  title  = {CoNVOI: Context-aware Navigation using Vision Language Models in Outdoor and Indoor Environments},
  author = {Adarsh Jagan Sathyamoorthy and Kasun Weerakoon and Mohamed Elnoor and Anuj Zore and Brian Ichter and Fei Xia and Jie Tan and Wenhao Yu and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2403.15637},
  year   = {2024}
}

备注

9 pages, 4 figures