面向大规模地标检索的两阶段判别重排序
计算机视觉与模式识别
2020-03-26 v1
摘要
我们提出一种高效的大规模地标图像检索流程,通过两阶段判别重排序应对数据集的多样性。我们的方法基于使用以余弦 softmax 损失训练的卷积神经网络将图像嵌入特征空间。由于图像存在视角极端变化(如须从地标内部图像检索其外部图像),仅依赖视觉相似度的方法极具挑战性。我们提出的重排序方法分两步改进结果:在排序步中,采用带软投票的 近邻搜索,依据与查询图像的标签相似度对检索结果排序;在插入步中,我们添加数据集中未被图像相似度检索到的额外样本。该方法可克服检索图像视觉多样性低的问题。深入的实验结果表明,所提方法在具挑战性的 Google Landmarks 数据集上显著优于现有方法。使用我们的方法,我们在 Kaggle 的 Google Landmark Retrieval 2019 挑战赛中获得第 1 名,在 Google Landmark Recognition 2019 挑战赛中获得第 3 名。我们的代码公开于:\url{https://github.com/lyakaap/Landmark2019-1st-and-3rd-Place-Solution}
引用
@article{arxiv.2003.11211,
title = {Two-stage Discriminative Re-ranking for Large-scale Landmark Retrieval},
author = {Shuhei Yokoo and Kohei Ozaki and Edgar Simo-Serra and Satoshi Iizuka},
journal= {arXiv preprint arXiv:2003.11211},
year = {2020}
}
备注
10 pages, 5 figures