中文

梯度下降在浅线性网络中收敛于比梯度流更平坦的最小值

机器学习 2025-01-22 v2 最优化与控制 机器学习

摘要

我们研究了深度为 2 的线性神经网络的梯度下降 (GD) 动力学,该网络仅有一个输入和一个输出。我们证明了即使使用较大的步长,GD 也以显式的线性收敛率收敛于训练损失的全局最小值,步长约为 2/sharpness2/\textrm{sharpness}。即使对于更大的步长,GD 仍然会收敛,但可能收敛得很慢。我们还描述了 GD 收敛到的解具有较低的范数和锐度,这与梯度流解不同。我们的分析揭示了收敛速度与隐式正则化幅度之间的权衡。这阐明了在“稳定边缘”训练的优势,即通过延迟收敛来诱导额外的正则化,可能对训练更复杂的模型具有启示意义。

关键词

引用

@article{arxiv.2501.09137,
  title  = {Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks},
  author = {Pierfrancesco Beneventano and Blake Woodworth},
  journal= {arXiv preprint arXiv:2501.09137},
  year   = {2025}
}

备注

23 pages, 3 figures