中文

面向大规模图像定位的自监督细粒度区域相似性

计算机视觉与模式识别 2020-07-10 v2

摘要

基于检索的大规模图像定位任务,是通过从城市尺度数据集中识别查询图像的最近参考图像来估计其地理位置。然而,公开基准仅提供与训练图像关联的带噪 GPS 标签,其作为学习图像间相似性的弱监督。此类标签噪声阻碍深度神经网络学习具有判别力的特征以实现准确定位。为应对该挑战,我们提出自监督图像到区域的相似性,以充分挖掘困难正样本图像及其子区域的潜力。所估计的图像到区域相似性可作为额外训练监督在迭代中改进网络,进而逐步精炼细粒度相似性以达到最优性能。我们提出的自增强图像到区域相似性标签,在训练和推理中无需任何额外参数或人工标注,便有效解决了最先进流程中的训练瓶颈。我们的方法在标准定位基准上以显著优势超越 SOTA,并在多个图像检索数据集上展现出优异的泛化能力。

关键词

引用

@article{arxiv.2006.03926,
  title  = {Self-supervising Fine-grained Region Similarities for Large-scale Image Localization},
  author = {Yixiao Ge and Haibo Wang and Feng Zhu and Rui Zhao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2006.03926},
  year   = {2020}
}

备注

Accepted in ECCV 2020 (Spotlight), code is available at https://github.com/yxgeee/SFRS