中文

用于图像检索的深度视觉表示端到端学习

计算机视觉与模式识别 2017-05-08 v2

摘要

尽管深度学习已成为许多计算机视觉任务顶尖方法的基石,但迄今为止它未能给实例级图像检索带来类似改进。本文中,我们认为深度方法在图像检索上结果不佳的原因有三:i) 噪声训练数据,ii) 不恰当的深度架构,iii) 次优训练过程。我们解决了所有三个问题。首先,我们利用一个大规模但有噪声的地标数据集,并开发一种自动清洗方法,产生适合深度检索的训练集。其次,我们基于近期的R-MAC描述子,表明它可解释为深度可微架构,并给出增强它的改进。最后,我们用结合三个流与三元组损失(triplet loss)的连体架构(siamese architecture)训练该网络。在训练过程结束时,所提架构在单次前向传播中产生适于图像检索的全局图像表示。大量实验表明我们的方法显著优于先前的检索方法,包括基于代价高昂的局部描述子索引与空间验证的先进方法。在Oxford 5k、Paris 6k和Holidays上,我们分别报告了94.7、96.6和94.8的平均精度均值(mean average precision)。我们的表示也可使用乘积量化(product quantization)进行重度压缩而精度损失甚微。额外材料见 www.xrce.xerox.com/Deep-Image-Retrieval。

关键词

引用

@article{arxiv.1610.07940,
  title  = {End-to-end Learning of Deep Visual Representations for Image Retrieval},
  author = {Albert Gordo and Jon Almazan and Jerome Revaud and Diane Larlus},
  journal= {arXiv preprint arXiv:1610.07940},
  year   = {2017}
}

备注

Accepted for publication at the International Journal of Computer Vision (IJCV). Extended version of our ECCV2016 paper "Deep Image Retrieval: Learning global representations for image search"