中文

VG-SSL:面向视觉地理定位的自监督表示学习方法基准评测

计算机视觉与模式识别 2024-11-22 v3

摘要

视觉地理定位(VG)是从视觉输入识别地理位置的关键研究领域,尤其在机器人与车辆的自主导航中。当前VG方法通常从地理标注图像中学习特征提取器,以创建密集的、地理相关的表示。自监督学习(SSL)最近的进展已展示其利用无标注图像达到与监督技术相当性能的能力。本研究提出一种新颖的VG-SSL框架,专为VG中多样SSL方法的灵活集成与基准评测而设计,具有独特的地理相关配对策略GeoPair。通过广泛的性能分析,我们调整SSL技术以改进来自机器人与自主车辆中手持和车载相机的数据集上的VG。我们的结果表明,对比学习和信息最大化方法产生更优的地理特定表示质量,匹配或超越最先进VG技术的性能。据我们所知,这是VG中SSL的首次基准研究,突显了其在增强机器人与自主车辆的地理特定视觉表示方面的潜力。代码公开于 https://github.com/arplaboratory/VG-SSL。

关键词

引用

@article{arxiv.2308.00090,
  title  = {VG-SSL: Benchmarking Self-supervised Representation Learning Approaches for Visual Geo-localization},
  author = {Jiuhong Xiao and Gao Zhu and Giuseppe Loianno},
  journal= {arXiv preprint arXiv:2308.00090},
  year   = {2024}
}

备注

18 pages (including appendix, references), 7 figures, 7 tables. Accepted for WACV 2025