中文

VLM-Loc:基于视觉语言模型的点云地图定位

计算机视觉与模式识别 2026-03-11 v1

摘要

文本到点云(T2P)定位旨在从自然语言描述中推断出3D点云地图中的精确空间位置,反映了人类如何通过语言来感知和交流空间布局。然而,现有方法大多依赖浅层的文本-点云对应关系,缺乏有效的空间推理,限制了其在复杂环境中的准确性。为此,我们提出了 VLM-Loc,一个利用大型视觉语言模型(VLM)进行T2P定位的框架。具体而言,我们将点云转换为鸟瞰视角(BEV)图像和场景图,这些图像和图 jointly 编码了几何和语义上下文,为VLM提供结构化输入,以学习连接语言和空间语义的跨模态表示。在这些表示之上,我们引入一种部分节点分配机制,显式地将文本线索与场景图节点关联,实现对准确定位的可解释空间推理。为便于在多样化场景中进行系统评估,我们呈现了 CityLoc,一个来自多源点云的基准,用于细粒度T2P定位。CityLoc上的实验表明,VLM-Loc 在准确性和鲁棒性方面优于当前最先进的方法。我们的代码、模型和数据集均可用于 \href{https://github.com/MCG-NKU/nku-3d-vision}{repository}。

关键词

引用

@article{arxiv.2603.09826,
  title  = {VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models},
  author = {Shuhao Kang and Youqi Liao and Peijie Wang and Wenlong Liao and Qilin Zhang and Benjamin Busam and Xieyuanli Chen and Yun Liu},
  journal= {arXiv preprint arXiv:2603.09826},
  year   = {2026}
}

备注

CVPR 2026