中文

面向视觉定位的图像检索基准评测

计算机视觉与模式识别 2020-12-02 v2 机器学习

摘要

视觉定位,即已知场景中的相机位姿估计,是自动驾驶和增强现实等技术的核心组成部分。最先进的定位方法通常依赖图像检索技术来完成以下两项任务之一:(1)提供近似位姿估计,或(2)确定给定查询图像中潜在可见的场景部分。对这些任务使用最先进的图像检索算法是常见做法。这些算法通常针对在大范围视角变化下检索同一地标的目标进行训练。然而,在视觉定位的背景下,对视角变化的鲁棒性未必是可取的。本文聚焦于理解图像检索在多种视觉定位任务中的作用。我们引入了一种基准设置,并在多个数据集上比较了最先进的检索表示。我们表明,经典地标检索/识别任务上的检索性能仅对部分而非全部定位任务与定位性能相关。这表明需要专门面向定位任务设计的检索方法。我们的基准和评估协议可在 https://github.com/naver/kapture-localization 获取。

关键词

引用

@article{arxiv.2011.11946,
  title  = {Benchmarking Image Retrieval for Visual Localization},
  author = {Noé Pion and Martin Humenberger and Gabriela Csurka and Yohann Cabon and Torsten Sattler},
  journal= {arXiv preprint arXiv:2011.11946},
  year   = {2020}
}

备注

International Conference on 3D Vision, 2020