中文

CNN中的结构化感受野

计算机视觉与模式识别 2016-05-16 v2

摘要

当训练数据有限时,利用CNN学习强大的特征表示是困难的。预训练是克服此问题的一种方法,但它需要与目标域足够相似的大型数据集。另一种选择是将先验设计到模型中,这可以从调优超参数到完全工程化的表示(如散射网络Scattering Networks)不等。我们将这些思想结合为结构化感受野网络,这是一种具有固定滤波器基但仍保留CNN灵活性的模型。这种灵活性通过将CNN中的感受野表示为固定基上的加权和来实现,其精神类似于散射网络。关键区别在于我们从基中学习任意的有效滤波器集合,而不是对滤波器建模。该方法显式地将经典多尺度图像分析与通用CNN连接起来。利用结构化感受野网络,我们在小和中等数据集场景下相比非结构化CNN有显著改进,并且在大型数据集上优于散射网络。我们在ILSVRC2012、Cifar-10、Cifar-100和MNIST上验证了我们的发现。作为一个现实的小数据集例子,我们在流行的3D MRI脑部疾病数据集上展示了最先进的分类结果,其中由于类似域缺乏大型公共数据集,预训练很困难。

关键词

引用

@article{arxiv.1605.02971,
  title  = {Structured Receptive Fields in CNNs},
  author = {Jörn-Henrik Jacobsen and Jan van Gemert and Zhongyu Lou and Arnold W. M. Smeulders},
  journal= {arXiv preprint arXiv:1605.02971},
  year   = {2016}
}

备注

Reason for update: i) Fix Reference for "Deep roto-translation scattering for object classification" by Oyallon and Mallat. ii) Fixed two minor typos. iii) Removed implicit assumption in equation (4) where scale is represented with diffusion time and adapted to rest of paper where scale is represented with standard deviation, to avoid possible confusion