中文

具有自动定位的潜在模型集成

计算机视觉与模式识别 2016-10-12 v2

摘要

深度卷积神经网络(CNN)由于较大的学习能力和抗过拟合性,在许多视觉识别任务(包括图像分类、物体检测和场景标注)中表现出优越性能。对于图像分类任务,当前大多数基于深度CNN的方法将整个尺寸归一化图像作为输入,并取得了相当有前景的结果。与之前基于特征提取、池化和分类的主导方法相比,基于深度CNN的方法主要依赖深度CNN的学习能力来取得优越结果:在最小化类内差异的同时最大化类间差异的负担完全依赖于深度CNN的隐式特征学习组件;我们依靠隐式学习的滤波器和池化组件来选择判别区域,这些区域对应于被激活的神经元。然而,如果无关区域构成了感兴趣图像的很大一部分,以整图作为输入的深度CNN的分类性能会受到严重影响。为解决此问题,我们提出了一种新颖的潜在CNN框架,其将最具判别性的区域视为潜在变量。我们可以联合学习全局CNN与潜在CNN,以避免上述大无关区域问题,并且我们的实验结果显示了所提潜在CNN相对于传统深度CNN的明显优势:在标准基准数据集(包括CIFAR-10、CIFAR-100、MNIST和PASCAL VOC 2007分类数据集)上,潜在CNN超越了深度CNN的最先进性能。

关键词

引用

@article{arxiv.1604.04333,
  title  = {Latent Model Ensemble with Auto-localization},
  author = {Miao Sun and Tony X. Han and Xun Xu and Ming-Chang Liu and Ahmad Khodayari-Rostamabad},
  journal= {arXiv preprint arXiv:1604.04333},
  year   = {2016}
}

备注

International Conference on Pattern Recognition (ICPR) 2016