重新审视面向大规模应用的视觉地理定位
计算机视觉与模式识别
2022-04-08 v2
摘要
视觉地理定位(VG)是指通过将给定的照片与已知位置的 Large 规模图像数据库进行比较,来估计该照片拍摄位置的任务。为探究现有技术在真实城市级 VG 应用中的表现,我们构建了 San Francisco eXtra Large,一个覆盖整座城市并提供广泛挑战性案例的新数据集,其规模是先前最大视觉地理定位数据集的 30 倍。我们发现当前方法无法扩展到如此大的数据集,因此设计了一种名为 CosPlace 的新型高度可扩展训练技术,该技术将训练视为分类问题,避免了常用对比学习所需的昂贵挖掘。我们在广泛的数据集上取得了最先进的性能,并发现 CosPlace 对严重的域变化具有鲁棒性。此外,我们表明,与先前最先进方法相比,CosPlace 在训练时所需 GPU 内存约减少 80%,且以 8 倍小的描述子取得更好结果,为城市级真实世界视觉地理定位铺平了道路。数据集、代码与训练模型可用于研究,见 https://github.com/gmberton/CosPlace。
引用
@article{arxiv.2204.02287,
title = {Rethinking Visual Geo-localization for Large-Scale Applications},
author = {Gabriele Berton and Carlo Masone and Barbara Caputo},
journal= {arXiv preprint arXiv:2204.02287},
year = {2022}
}
备注
CVPR 2022