正交输入下平方损失浅层 ReLU 网络的梯度流动力学
机器学习
2026-04-15 v3 机器学习
摘要
通过梯度下降方法训练神经网络是深度学习革命的基石。然而,尽管近期取得一些进展,解释其成功的完整理论仍缺失。本文针对正交输入向量,精确描述了在小初始化下训练单隐藏层 ReLU 神经网络求解均方误差的梯度流动力学。在此设定下,尽管非凸,我们证明梯度流收敛到零损失,并刻画了其朝向最小变分范数的隐式偏置。此外,突出了一些有趣现象:初始对齐现象的定量描述,以及证明该过程遵循特定的鞍点到鞍点动力学。
引用
@article{arxiv.2206.00939,
title = {Gradient flow dynamics of shallow ReLU networks for square loss and orthogonal inputs},
author = {Etienne Boursier and Loucas Pillaud-Vivien and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2206.00939},
year = {2026}
}
备注
corrected Proposition 1