中文

应用于视觉实例检索的 CNN 最佳实践是什么?

计算机视觉与模式识别 2016-11-08 v1

摘要

先前的工作表明,深度卷积神经网络 (CNNs) 的特征图可以被解释为特定图像区域的特征表示。从这些特征图中聚合的特征已被用于图像检索任务,并在近年来取得了最先进的性能。此类方法成功的关键在于特征表示。然而,影响特征有效性的不同因素尚未得到充分探索,关于它们的最佳组合的讨论也少之又少。本文的主要贡献是对影响从 CNNs 提取的特征判别能力的各种因素进行了彻底评估。基于评估结果,我们还确定了不同因素的最佳选择,并提出了一种新的多尺度图像特征表示方法以有效地编码图像。最后,我们展示了所提出的方法具有良好的泛化能力,并在四个用于视觉实例检索的典型数据集上优于最先进的方法。

关键词

引用

@article{arxiv.1611.01640,
  title  = {What Is the Best Practice for CNNs Applied to Visual Instance Retrieval?},
  author = {Jiedong Hao and Jing Dong and Wei Wang and Tieniu Tan},
  journal= {arXiv preprint arXiv:1611.01640},
  year   = {2016}
}

备注

The verison submitted to ICLR