梯度下降在浅线性网络中收敛于比梯度流更平坦的最小值
机器学习
2025-01-22 v2 最优化与控制
机器学习
摘要
我们研究了深度为 2 的线性神经网络的梯度下降 (GD) 动力学,该网络仅有一个输入和一个输出。我们证明了即使使用较大的步长,GD 也以显式的线性收敛率收敛于训练损失的全局最小值,步长约为 。即使对于更大的步长,GD 仍然会收敛,但可能收敛得很慢。我们还描述了 GD 收敛到的解具有较低的范数和锐度,这与梯度流解不同。我们的分析揭示了收敛速度与隐式正则化幅度之间的权衡。这阐明了在“稳定边缘”训练的优势,即通过延迟收敛来诱导额外的正则化,可能对训练更复杂的模型具有启示意义。
引用
@article{arxiv.2501.09137,
title = {Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks},
author = {Pierfrancesco Beneventano and Blake Woodworth},
journal= {arXiv preprint arXiv:2501.09137},
year = {2025}
}
备注
23 pages, 3 figures