中文

梯度下降在标量网络及更广范围内单调降低梯度流解的锐度

机器学习 2023-05-23 v1 最优化与控制 机器学习

摘要

近期研究表明,当将梯度下降(GD)应用于神经网络时,损失几乎从不单调下降。相反,随着梯度下降收敛到其“稳定边缘”(EoS),损失会发生振荡。在此,我们发现一个在整个 GD 训练过程中确实单调下降的量:梯度流解(GFS)所达到的锐度——即从当前时刻起直至收敛、以无穷小步长训练将获得的解。理论上,我们分析了具有平方损失的标量神经网络,这或许是 EoS 现象仍然发生的最简单设定。在该模型中,我们证明 GFS 锐度单调下降。利用这一结果,我们刻画了 GD 在标量网络中可证明收敛到 EoS 的设定。在实证上,我们表明 GD 在平方回归模型以及实用神经网络架构中单调降低 GFS 锐度。

关键词

引用

@article{arxiv.2305.13064,
  title  = {Gradient Descent Monotonically Decreases the Sharpness of Gradient Flow Solutions in Scalar Networks and Beyond},
  author = {Itai Kreisler and Mor Shpigel Nacson and Daniel Soudry and Yair Carmon},
  journal= {arXiv preprint arXiv:2305.13064},
  year   = {2023}
}