EigenPlaces:为视觉地点识别训练视角鲁棒模型
计算机视觉与模式识别
2023-08-22 v1
摘要
视觉地点识别(Visual Place Recognition)是一项仅基于图像(称为查询图像)的视觉特征来预测其所在地点的任务。这通常通过图像检索来实现:利用学习到的全局描述子,将查询图像与带有地理标签的照片大型数据库中最相似的图像进行匹配。该任务的一个主要挑战是识别从不同的视角看到的地点。为克服这一局限,我们提出了一种称为 EigenPlaces 的新方法,在不同的视角图像上训练我们的神经网络,从而将视角鲁棒性嵌入到学习到的全局描述子中。其基本思想是对训练数据进行聚类,以显式地向模型呈现相同兴趣点的不同视图。这些兴趣点的选取无需额外的监督。随后我们在文献中最全面的数据集集合上进行了实验,发现 EigenPlaces 能够在大多数数据集上超越以往的 state of the art,同时训练所需的 GPU 内存减少 60%,且使用的描述子尺寸减小 50%。EigenPlaces 的代码和训练好的模型可在 {\small{\url{https://github.com/gmberton/EigenPlaces}}} 获取,而使用任何其他基线模型的结果可通过代码库 {\small{\url{https://github.com/gmberton/auto_VPR}}} 计算。
引用
@article{arxiv.2308.10832,
title = {EigenPlaces: Training Viewpoint Robust Models for Visual Place Recognition},
author = {Gabriele Berton and Gabriele Trivigno and Barbara Caputo and Carlo Masone},
journal= {arXiv preprint arXiv:2308.10832},
year = {2023}
}
备注
ICCV 2023