具有自动定位的潜在模型集成
计算机视觉与模式识别
2016-10-12 v2
摘要
深度卷积神经网络(CNN)由于较大的学习能力和抗过拟合性,在许多视觉识别任务(包括图像分类、物体检测和场景标注)中表现出优越性能。对于图像分类任务,当前大多数基于深度CNN的方法将整个尺寸归一化图像作为输入,并取得了相当有前景的结果。与之前基于特征提取、池化和分类的主导方法相比,基于深度CNN的方法主要依赖深度CNN的学习能力来取得优越结果:在最小化类内差异的同时最大化类间差异的负担完全依赖于深度CNN的隐式特征学习组件;我们依靠隐式学习的滤波器和池化组件来选择判别区域,这些区域对应于被激活的神经元。然而,如果无关区域构成了感兴趣图像的很大一部分,以整图作为输入的深度CNN的分类性能会受到严重影响。为解决此问题,我们提出了一种新颖的潜在CNN框架,其将最具判别性的区域视为潜在变量。我们可以联合学习全局CNN与潜在CNN,以避免上述大无关区域问题,并且我们的实验结果显示了所提潜在CNN相对于传统深度CNN的明显优势:在标准基准数据集(包括CIFAR-10、CIFAR-100、MNIST和PASCAL VOC 2007分类数据集)上,潜在CNN超越了深度CNN的最先进性能。
引用
@article{arxiv.1604.04333,
title = {Latent Model Ensemble with Auto-localization},
author = {Miao Sun and Tony X. Han and Xun Xu and Ming-Chang Liu and Ahmad Khodayari-Rostamabad},
journal= {arXiv preprint arXiv:1604.04333},
year = {2016}
}
备注
International Conference on Pattern Recognition (ICPR) 2016