中文

用于目标分类的深度 FisherNet

计算机视觉与模式识别 2016-08-02 v1 机器学习

摘要

尽管卷积神经网络(CNN)在 Cifar 和 ImageNet 等数据集上的图像分类任务取得了巨大成功,但 CNN 的表示能力在处理尺寸和背景杂乱变化较大的目标图像时仍有一定局限,而 Fisher 向量(FV)已被证明是一种有效的编码策略。FV 通过用通用的生成式高斯混合模型(GMM)聚合局部描述子来编码图像。然而 FV 的学习能力有限,且其参数在构建码本后大多固定。为了结合两者之长,我们在本文中提出一种神经网络结构,其中 FV 层作为可端到端训练且可微系统的一部分;我们将我们的网络命名为 FisherNet,可使用反向传播进行学习。我们提出的 FisherNet 将卷积神经网络训练与 Fisher 向量编码结合在单一的端到端结构中。我们在具有挑战性的 PASCAL VOC 目标分类任务上观察到 FisherNet 相较于普通 CNN 和标准 FV 在分类准确率和计算效率方面的明显优势。

关键词

引用

@article{arxiv.1608.00182,
  title  = {Deep FisherNet for Object Classification},
  author = {Peng Tang and Xinggang Wang and Baoguang Shi and Xiang Bai and Wenyu Liu and Zhuowen Tu},
  journal= {arXiv preprint arXiv:1608.00182},
  year   = {2016}
}

备注

submitted to NIPS 2016