中文

训练极深神经网络的层渐进DropIn方法

神经与进化计算 2015-11-24 v1 计算机视觉与模式识别 机器学习

摘要

我们提出了在训练过程中动态增长神经网络的概念。具体而言,一个不可训练的深层网络起始于一个可训练的浅层网络,新增加的层在训练过程中缓慢、自然地加入,从而增加网络深度。这通过我们称之为DropIn的新层实现。DropIn层起初传递前一层的输出(有效地跳过新加入的层),然后逐渐在正向传播和反向传播中包含来自新层的单元。我们表明,用常规方法不可训练的深层网络,在架构中穿插DropIn层后将收敛。此外,我们证明DropIn在训练期间以提供正则化的方式类似于dropout。实验描述了在MNIST数据集和各种扩展的LeNet架构、CIFAR-10数据集(其架构从3层扩展到11层)以及ImageNet数据集(AlexNet架构扩展到13层及VGG 16层架构)上的结果。

关键词

引用

@article{arxiv.1511.06951,
  title  = {Gradual DropIn of Layers to Train Very Deep Neural Networks},
  author = {Leslie N. Smith and Emily M. Hand and Timothy Doster},
  journal= {arXiv preprint arXiv:1511.06951},
  year   = {2015}
}