中文

3D 视觉与机器人学中图像对检索的视觉地点识别方法评估

计算机视觉与模式识别 2026-03-17 v1

摘要

视觉地点识别 (VPR) 是计算机视觉的核心组成部分,通常被表述为用于定位、建图和导航的图像检索任务。在这项工作中,我们转而将 VPR 研究为注册流水线的图像对检索前端,其目标是在两个不相交的图像集之间找到最佳匹配的图像对,用于下游任务如场景注册、SLAM 和运动恢复结构。我们对最先进的 VPR 族——NetVLAD 风格基线、基于分类的全局描述符 (CosPlace, EigenPlaces)、特征混合 (MixVPR) 以及基础模型驱动的方法 (AnyLoc, SALAD, MegaLoc)——在三个具有挑战性的数据集上进行了比较评估:面向对象的户外场景 (Tanks and Temples)、室内 RGB-D 扫描 (ScanNet-GS) 和自动驾驶序列 (KITTI)。我们表明,现代全局描述符方法在具有感知混淆和不完整序列等具有挑战性的场景中越来越适合作为现成的图像对检索模块,同时展现出清晰的、领域依赖的优势和劣势,这在为鲁棒建图和注册选择 VPR 组件时至关重要。

关键词

引用

@article{arxiv.2603.13917,
  title  = {Evaluation of Visual Place Recognition Methods for Image Pair Retrieval in 3D Vision and Robotics},
  author = {Dennis Haitz and Athradi Shritish Shetty and Michael Weinmann and Markus Ulrich},
  journal= {arXiv preprint arXiv:2603.13917},
  year   = {2026}
}

备注

Accepted at the XXV ISPRS Congress 2026; to appear in the ISPRS Annals