仅靠良好初始化还不够:探索利用正交性与调制训练极深卷积神经网络的更优解
计算机视觉与模式识别
2017-04-11 v3 机器学习
神经与进化计算
摘要
深度神经网络难以训练,且随着深度增加这一困境愈发严重。该问题的本质在于反向传播误差的大小会导致梯度消失或爆炸现象。我们证明,一种利用不同滤波器组之间正交性的正则化变体可以缓解这一问题。此外,我们基于两个连续参数化层之间的拟等距假设,设计了一种反向误差调制机制。结合这两项要素,我们提出了几种新颖的优化方案,可用于从头开始训练特定结构(重复的 Conv-BNReLU 三元模块)的极深卷积神经网络(CNN),无需任何捷径/恒等映射。实验表明,我们提出的方案在 CIFAR-10 和 ImageNet 数据集上,对 44 层和 110 层普通网络均能取得显著改进。此外,我们能够成功训练普通 CNN 以匹配其残差对应结构的性能。同时,我们从正交性带来的洞见出发,提出了设计网络结构的新原则。结合残差结构,我们在 ImageNet 数据集上取得了有竞争力的性能。
引用
@article{arxiv.1703.01827,
title = {All You Need is Beyond a Good Init: Exploring Better Solution for Training Extremely Deep Convolutional Neural Networks with Orthonormality and Modulation},
author = {Di Xie and Jiang Xiong and Shiliang Pu},
journal= {arXiv preprint arXiv:1703.01827},
year = {2017}
}
备注
Updating experiments; CVPR2017