深度线性网络中鞍点至鞍点区域的随机梯度下降动力学
机器学习
2026-04-09 v1 机器学习
摘要
深度线性网络(DLNs)被用作深度神经网络训练动力学的一种可解析分析模型。虽然已知DLNs中的梯度下降表现出鞍点至鞍点动力学,但随机梯度下降(SGD)噪声对该区域的影响仍了解甚少。我们研究了DLNs在鞍点至鞍点区域中训练时SGD的动力学。将训练动力学建模为具有各向异性、状态依赖噪声的随机朗之万动力学。在权重对齐且平衡的假设下,我们推导出动力学向一组一维每模态随机微分方程的精确分解。这表明,沿某一模态的最大扩散先于对应特征被完全学习。我们还推导了SGD对每个模态的稳态分布:在无标签噪声的情况下,其沿特定特征的边际分布与梯度流的稳态分布一致;而在存在标签噪声的情况下,它近似于玻尔兹曼分布。最后,我们通过实验确认,即使在没有对齐或平衡权重的情况下,理论结果在定性上仍然成立。这些结果表明,SGD噪声编码了特征学习进展的信息,但并未从根本上改变鞍点至鞍点动力学。
引用
@article{arxiv.2604.06366,
title = {Stochastic Gradient Descent in the Saddle-to-Saddle Regime of Deep Linear Networks},
author = {Guillaume Corlouer and Avi Semler and Alexander Strang and Alexander Gietelink Oldenziel},
journal= {arXiv preprint arXiv:2604.06366},
year = {2026}
}