通过动力等距性复兴深度学习中的 sigmoid:理论与实践
机器学习
2017-11-15 v1 机器学习
摘要
众所周知,深度神经网络中权重的初始化对学习速度有显著影响。例如,确保网络输入-输出雅可比矩阵均方奇异值为 对于避免梯度的指数级消失或爆炸至关重要。更强的条件是雅可比矩阵所有奇异值都集中在 附近,这一性质被称为动力等距性。对于深度线性网络,动力等距性可通过正交权重初始化实现,且已被证明能大幅加速学习;然而,如何将这些结果推广到非线性设置仍不清楚。我们通过采用自由概率论中的强大工具来分析计算深度网络输入-输出雅可比矩阵的整个奇异值分布,从而解决这一问题。我们探究了奇异值分布对网络深度、权重初始化以及非线性选择的影响。有趣的是,我们发现 ReLU 网络无法实现动力等距性。另一方面,sigmoidal 网络可以实现等距性,但仅能通过正交权重初始化实现。此外,我们通过实证表明,实现动力等距性的深度非线性网络比未实现的网络学习速度快数个数量级。事实上,我们展示了适当初始化的深度 sigmoidal 网络始终优于深度 ReLU 网络。总体而言,我们的分析揭示,控制雅可比奇异值的整个分布是深度学习中的一个重要设计考量。
引用
@article{arxiv.1711.04735,
title = {Resurrecting the sigmoid in deep learning through dynamical isometry: theory and practice},
author = {Jeffrey Pennington and Samuel S. Schoenholz and Surya Ganguli},
journal= {arXiv preprint arXiv:1711.04735},
year = {2017}
}
备注
13 pages, 6 figures. Appearing at the 31st Conference on Neural Information Processing Systems (NIPS 2017)