中文

E$^2$BoWs:基于深度卷积神经网络的端到端词袋模型

计算机视觉与模式识别 2017-09-21 v2

摘要

传统的视觉词袋(BoWs)模型通常通过包括局部特征提取、码本生成和特征量化等许多步骤生成。这些步骤彼此相对独立且难以联合优化。此外,对手工局部特征的依赖使得BoWs模型在传达高级语义方面效率不高。这些问题在很大程度上阻碍了BoWs模型在大规模图像应用中的性能。为克服这些问题,我们提出了一种基于深度卷积神经网络(DCNN)的端到端词袋(E2^2BoWs)模型。我们的模型将图像作为输入,然后识别并分离其中的语义对象,最后输出具有高语义判别力的视觉词。具体而言,我们的模型首先通过卷积层生成对应于不同对象类别的语义特征图(SFMs),然后引入词袋层(BoWL)为每个单独的特征图生成视觉词。我们还引入了一种新颖的学习算法来增强生成的E2^2BoWs模型的稀疏性,从而进一步确保时间和内存效率。我们在包括CIFAR-10、CIFAR-100、MIRFLICKR-25K和NUS-WIDE在内的几个图像检索数据集上评估了所提出的E2^2BoWs模型。实验结果表明,与近期基于深度学习的检索工作相比,我们的方法取得了令人满意的准确性和效率。

关键词

引用

@article{arxiv.1709.05903,
  title  = {E$^2$BoWs: An End-to-End Bag-of-Words Model via Deep Convolutional Neural Network},
  author = {Xiaobin Liu and Shiliang Zhang and Tiejun Huang and Qi Tian},
  journal= {arXiv preprint arXiv:1709.05903},
  year   = {2017}
}

备注

8 pages, ChinaMM 2017, image retrieval