中文

正交输入下平方损失浅层 ReLU 网络的梯度流动力学

机器学习 2026-04-15 v3 机器学习

摘要

通过梯度下降方法训练神经网络是深度学习革命的基石。然而,尽管近期取得一些进展,解释其成功的完整理论仍缺失。本文针对正交输入向量,精确描述了在小初始化下训练单隐藏层 ReLU 神经网络求解均方误差的梯度流动力学。在此设定下,尽管非凸,我们证明梯度流收敛到零损失,并刻画了其朝向最小变分范数的隐式偏置。此外,突出了一些有趣现象:初始对齐现象的定量描述,以及证明该过程遵循特定的鞍点到鞍点动力学。

关键词

引用

@article{arxiv.2206.00939,
  title  = {Gradient flow dynamics of shallow ReLU networks for square loss and orthogonal inputs},
  author = {Etienne Boursier and Loucas Pillaud-Vivien and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2206.00939},
  year   = {2026}
}

备注

corrected Proposition 1