中文

深度线性网络中的鞍点到鞍点动力学:小初始化训练、对称性与稀疏性

机器学习 2022-02-01 v2 机器学习

摘要

深度线性网络(DLNs)的动力学受到初始化参数 θ0\theta_0 的方差 σ2\sigma^2 的显著影响。对于宽度为 ww 的 DLN,我们展示了关于方差 σ2=wγ\sigma^2=w^{-\gamma} 的缩放 γ\gammaww\to\infty 时的相变:对于大方差(γ<1\gamma<1),θ0\theta_0 非常接近全局极小值但远离任何鞍点;对于小方差(γ>1\gamma>1),θ0\theta_0 接近鞍点且远离任何全局极小值。第一种情况对应于被广泛研究的 NTK regime,而第二种情况则较少被理解。这促使我们研究 γ+\gamma \to +\infty 的情形,其中我们猜想一种鞍点到鞍点(Saddle-to-Saddle)动力学:在整个训练过程中,梯度下降会访问一系列鞍点邻域,每个鞍点对应于秩递增的线性映射,直到达到一个稀疏的全局极小值。我们以第一个和第二个鞍点之间动力学的定理以及一些数值实验支持这一猜想。

关键词

引用

@article{arxiv.2106.15933,
  title  = {Saddle-to-Saddle Dynamics in Deep Linear Networks: Small Initialization Training, Symmetry, and Sparsity},
  author = {Arthur Jacot and François Ged and Berfin Şimşek and Clément Hongler and Franck Gabriel},
  journal= {arXiv preprint arXiv:2106.15933},
  year   = {2022}
}