深度线性神经网络学习非线性动力学的精确解
神经与进化计算
2014-02-20 v3 无序系统与神经网络
计算机视觉与模式识别
机器学习
神经元与认知
机器学习
摘要
尽管深度学习方法在实践中取得了广泛成功,但我们对深度神经网络学习动力学的理论理解仍然相当稀疏。我们试图通过系统分析深度线性神经网络这一受限情况下的学习动力学,来弥合深度学习的理论与实践之间的差距。尽管其输入 - 输出映射是线性的,但随着每个新隐藏层的增加,此类网络在权重上表现出非线性梯度下降动力学。我们表明,深度线性网络展现出与非线性网络模拟中类似的非线性学习现象,包括漫长的平台期随后迅速过渡到更低误差的解,以及从贪婪无监督预训练初始条件出发比从随机初始条件出发收敛更快。我们通过找到深度学习非线性动力学的新精确解,对这些现象提供了解析描述。我们的理论分析还揭示了一个令人惊讶的发现:当网络深度趋近于无穷大时,学习速度仍可保持有限;对于一类特殊的权重初始条件,极深网络相对于浅层网络仅产生有限的、与深度无关的学习速度延迟。我们表明,在训练数据的某些条件下,无监督预训练可以找到这类特殊的初始条件,而缩放的随机高斯初始化则不能。我们进一步展示了一类新的权重随机正交初始条件,与无监督预训练一样,享有与深度无关的学习时间。我们还表明,只要这些初始条件在被称为“混沌边缘”的特殊机制下运行,它们也能在深度非线性网络中实现梯度的忠实传播。
引用
@article{arxiv.1312.6120,
title = {Exact solutions to the nonlinear dynamics of learning in deep linear neural networks},
author = {Andrew M. Saxe and James L. McClelland and Surya Ganguli},
journal= {arXiv preprint arXiv:1312.6120},
year = {2014}
}
备注
Submission to ICLR2014. Revised based on reviewer feedback