一维深度线性神经网络梯度下降的指数级收敛时间
机器学习
2019-06-14 v4 神经与进化计算
最优化与控制
机器学习
摘要
我们研究了在形式为 的目标函数(关于标量参数 )上梯度下降的动力学,这类函数出现在训练深度为 的线性神经网络的场景中。我们证明,对于标准随机初始化,并在对 的温和假设下,收敛所需的迭代次数随深度 呈指数级增长。我们还通过实验表明,这一现象可能发生在更高维情形中,其中每个 是一个矩阵。这凸显了在理解深度线性神经网络(其中 较大)基于梯度方法的收敛性时的一个潜在障碍。
引用
@article{arxiv.1809.08587,
title = {Exponential Convergence Time of Gradient Descent for One-Dimensional Deep Linear Neural Networks},
author = {Ohad Shamir},
journal= {arXiv preprint arXiv:1809.08587},
year = {2019}
}
备注
Comparison to previous version: Fixed a bug in lemma 1 part 3 (does not affect any other part of the paper)