中文

探究图像检索在视觉定位中的作用——一项详尽基准测试

计算机视觉与模式识别 2022-06-01 v1 人工智能 机器学习

摘要

视觉定位,即已知场景中的相机位姿估计,是自动驾驶与增强现实等技术的核心组件。最先进的定位方法常依赖图像检索技术以实现以下两个目的之一:(1)提供近似位姿估计,或(2)确定给定查询图像中潜在可见的场景部分。对两者均使用最先进的图像检索算法是常见做法。这些算法常针对在大范围视角变化下检索同一地标的目标而训练,而这往往不同于视觉定位的需求。为探究其对视觉定位的影响,本文聚焦于理解图像检索在多种视觉定位范式中的作用。首先,我们引入一种新颖的基准设置,并在多个数据集上以定位性能为指标比较最先进的检索表示。其次,我们考察图像检索的若干“真值”定义。将这些定义作为视觉定位范式的上界,我们表明仍存在显著提升空间。第三,借助这些工具与深入分析,我们表明经典地标检索或地点识别任务上的检索性能仅对部分而非全部范式与定位性能相关。最后,我们分析了图像中模糊与动态场景的影响。我们得出结论:亟需专为定位范式设计的检索方法。我们的基准与评估协议可在 https://github.com/naver/kapture-localization 获取。

关键词

引用

@article{arxiv.2205.15761,
  title  = {Investigating the Role of Image Retrieval for Visual Localization -- An exhaustive benchmark},
  author = {Martin Humenberger and Yohann Cabon and Noé Pion and Philippe Weinzaepfel and Donghwan Lee and Nicolas Guérin and Torsten Sattler and Gabriela Csurka},
  journal= {arXiv preprint arXiv:2205.15761},
  year   = {2022}
}

备注

International Journal of Computer Vision (2022). arXiv admin note: text overlap with arXiv:2011.11946