中文

IVLMap:面向消费级机器人导航的实例感知视觉语言定位

计算机视觉与模式识别 2024-03-29 v1 人工智能

摘要

视觉语言导航(VLN)是一项具有挑战性的任务,要求机器人在具有真实感的环境中根据人类自然语言指令进行导航。近期的研究旨在通过构建环境的语义空间地图表示,并利用大语言模型强大的推理能力来生成指导机器人导航的代码,以处理该任务。然而,这些方法在实例级和属性级导航任务中面临局限性,因为它们无法区分同一物体的不同实例。为了应对这一挑战,我们提出了一种新方法,即实例感知视觉语言地图(IVLMap),赋予机器人实例级和属性级的语义建图能力。该地图通过融合从机器人智能体采集的 RGBD 视频数据与鸟瞰视角下专门设计的自然语言地图索引自主构建。该索引是实例级和属性级的。具体而言,当与大语言模型结合时,IVLMap 展现出以下能力:i) 将自然语言转换为包含实例和属性信息的导航目标,实现精确定位;ii) 基于自然语言指令完成零样本端到端导航任务。我们进行了广泛的导航实验。仿真结果表明,我们的方法在导航精度上平均提升了 14.4%。代码和演示已发布于 https://ivlmap.github.io/。

关键词

引用

@article{arxiv.2403.19336,
  title  = {IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation},
  author = {Jiacui Huang and Hongtao Zhang and Mingbo Zhao and Zhou Wu},
  journal= {arXiv preprint arXiv:2403.19336},
  year   = {2024}
}