中文

用于图像分类的 CNN 多重 VLAD 编码

计算机视觉与模式识别 2017-07-04 v1

摘要

尽管卷积神经网络(CNN)在图像分类任务中效果显著,但卷积特征对学习表征的影响仍然有限。现有方法主要关注图像的显著物体,却忽略了杂乱背景及局部区域的变化信息。本文提出了一种专门框架,即结合 CNN 特征的多重 VLAD 编码方法用于图像分类。此外,为了提升 VLAD 编码方法的性能,我们探索了 VLAD 编码的多重性,扩展了三种编码算法:VLAD-SA 方法、VLAD-LSA 方法和 VLAD-LLC 方法。最后,我们在 VLAD 编码上配备了空间金字塔匹配(SPM),以添加 CNN 特征的空间信息。特别是,SPM 的能力使得我们的框架相比现有方法取得了更好的性能。

关键词

引用

@article{arxiv.1707.00058,
  title  = {Multiple VLAD encoding of CNNs for image classification},
  author = {Qing Li and Qiang Peng and Chuan Yan},
  journal= {arXiv preprint arXiv:1707.00058},
  year   = {2017}
}