中文

一维深度线性神经网络梯度下降的指数级收敛时间

机器学习 2019-06-14 v4 神经与进化计算 最优化与控制 机器学习

摘要

我们研究了在形式为 f(i=1kwi)f(\prod_{i=1}^{k} w_i) 的目标函数(关于标量参数 w1,,wkw_1,\ldots,w_k)上梯度下降的动力学,这类函数出现在训练深度为 kk 的线性神经网络的场景中。我们证明,对于标准随机初始化,并在对 ff 的温和假设下,收敛所需的迭代次数随深度 kk 呈指数级增长。我们还通过实验表明,这一现象可能发生在更高维情形中,其中每个 wiw_i 是一个矩阵。这凸显了在理解深度线性神经网络(其中 kk 较大)基于梯度方法的收敛性时的一个潜在障碍。

关键词

引用

@article{arxiv.1809.08587,
  title  = {Exponential Convergence Time of Gradient Descent for One-Dimensional Deep Linear Neural Networks},
  author = {Ohad Shamir},
  journal= {arXiv preprint arXiv:1809.08587},
  year   = {2019}
}

备注

Comparison to previous version: Fixed a bug in lemma 1 part 3 (does not affect any other part of the paper)