中文

VGGT-MPR:面向自动驾驶环境的VGGT增强多模态地点识别

计算机视觉与模式识别 2026-02-24 v1

摘要

在自动驾驶领域,稳健的地点识别对于全局定位和环路闭合检测至关重要。虽然摄像头和LiDAR数据在多模态地点识别(MPR)中的跨模态融合显示出前景,但现有MPR方法基本上关注手工设计的融合策略和高度参数化的主干网络,需要高昂的重新训练成本。为此,我们提出了VGGT-MPR,一种采用Visual Geometry Grounded Transformer(VGGT)作为统一几何引擎的多模态地点识别框架,用于全局检索和重新排序。在全局检索阶段,VGGT通过基于深度和点图监督提取富含几何信息的视觉嵌入,并利用预测深度图稀疏LiDAR点云以提高结构表征。这增强了融合多模态特征的判别能力,产生用于快速检索的全局描述符。超越全局检索,我们设计了一种无需训练的重新排序机制,利用VGGT的跨视图关键点跟踪能力。通过结合掩码引导的关键点提取和置信感知的对应关系评分,我们提议的重新排序机制在无需额外参数优化的情况下有效地细化了检索结果。在大规模自动驾驶基准测试和自采数据上进行的广泛实验表明,VGGT-MPR实现了最先进的性能,展现出对严重环境变化、视角位移和遮挡的强大鲁棒性。我们的代码和数据将公开提供。

关键词

引用

@article{arxiv.2602.19735,
  title  = {VGGT-MPR: VGGT-Enhanced Multimodal Place Recognition in Autonomous Driving Environments},
  author = {Jingyi Xu and Zhangshuo Qi and Zhongmiao Yan and Xuyu Gao and Qianyun Jiao and Songpengcheng Xia and Xieyuanli Chen and Ling Pei},
  journal= {arXiv preprint arXiv:2602.19735},
  year   = {2026}
}