中文

用于大规模图像定位的随机吸引-排斥嵌入

计算机视觉与模式识别 2019-08-07 v2

摘要

本文解决大规模基于图像的定位(IBL)问题,其中查询图像的空间位置通过在大数据库中找出最相似的参考图像来确定。为解决此问题,一项关键任务是学习具有定位相关信息的判别性图像表示。我们提出一种具有更高位置判别力的新颖表示学习方法。其贡献如下:1)我们将一个场所(位置)表示为描绘相同地标的示例图像集合,旨在最大化场所内图像间的相似度,同时最小化场所间图像间的相似度;2)我们将相似度度量建模为场所内与场所间图像表示间L_2度量距离上的概率分布;3)我们提出一种新的随机吸引与排斥嵌入(SARE)损失函数,最小化学习到与实际概率分布间的KL散度;4)我们给出SARE、三元组排序和对比损失间的理论比较。通过分析梯度,它揭示了为何SARE更优。我们的SARE损失易于实现并可插入任意CNN。实验表明,我们提出的方法在标准基准上大幅提升了定位性能。为证明方法的广泛适用性,我们在2018年Google地标检索挑战赛209支队伍中获得第三名。我们的代码与模型见于https://github.com/Liumouliu/deepIBL。

关键词

引用

@article{arxiv.1808.08779,
  title  = {Stochastic Attraction-Repulsion Embedding for Large Scale Image Localization},
  author = {Liu Liu and Hongdong Li and Yuchao Dai},
  journal= {arXiv preprint arXiv:1808.08779},
  year   = {2019}
}

备注

ICCV