中文

仅靠良好初始化还不够:探索利用正交性与调制训练极深卷积神经网络的更优解

计算机视觉与模式识别 2017-04-11 v3 机器学习 神经与进化计算

摘要

深度神经网络难以训练,且随着深度增加这一困境愈发严重。该问题的本质在于反向传播误差的大小会导致梯度消失或爆炸现象。我们证明,一种利用不同滤波器组之间正交性的正则化变体可以缓解这一问题。此外,我们基于两个连续参数化层之间的拟等距假设,设计了一种反向误差调制机制。结合这两项要素,我们提出了几种新颖的优化方案,可用于从头开始训练特定结构(重复的 Conv-BNReLU 三元模块)的极深卷积神经网络(CNN),无需任何捷径/恒等映射。实验表明,我们提出的方案在 CIFAR-10 和 ImageNet 数据集上,对 44 层和 110 层普通网络均能取得显著改进。此外,我们能够成功训练普通 CNN 以匹配其残差对应结构的性能。同时,我们从正交性带来的洞见出发,提出了设计网络结构的新原则。结合残差结构,我们在 ImageNet 数据集上取得了有竞争力的性能。

关键词

引用

@article{arxiv.1703.01827,
  title  = {All You Need is Beyond a Good Init: Exploring Better Solution for Training Extremely Deep Convolutional Neural Networks with Orthonormality and Modulation},
  author = {Di Xie and Jiang Xiong and Shiliang Pu},
  journal= {arXiv preprint arXiv:1703.01827},
  year   = {2017}
}

备注

Updating experiments; CVPR2017