中文

稳定性边缘处的自适应梯度方法

机器学习 2024-04-17 v2

摘要

关于深度学习中 Adam 等自适应梯度方法的训练动态,人们知之甚少。本文中,我们阐明这些算法在全批量及足够大批量设定下的行为。具体而言,我们通过实验证明,在全批量训练期间,预条件 Hessian 的最大特征值通常平衡于某一数值——即梯度下降算法的稳定性阈值。对于步长 η\etaβ1=0.9\beta_1 = 0.9 的 Adam,该稳定性阈值为 38/η38/\eta。类似效应在最小批量训练期间亦会出现,尤其当批量大小增长时。然而,即便自适应方法训练于“自适应稳定性边缘”(AEoS),它们在此 regime 下的行为仍与非自适应方法在稳定性边缘(EoS)时有显著不同:非自适应算法在 EoS 处被阻挡进入损失景观的高曲率区域,而 AEoS 处的自适应梯度方法可在调整预条件子以补偿的同时持续推进至高曲率区域。我们的发现可作为学界未来理解深度学习中自适应梯度方法的基础。

关键词

引用

@article{arxiv.2207.14484,
  title  = {Adaptive Gradient Methods at the Edge of Stability},
  author = {Jeremy M. Cohen and Behrooz Ghorbani and Shankar Krishnan and Naman Agarwal and Sourabh Medapati and Michal Badura and Daniel Suo and David Cardoze and Zachary Nado and George E. Dahl and Justin Gilmer},
  journal= {arXiv preprint arXiv:2207.14484},
  year   = {2024}
}

备注

v2 corrects the formula for Adam's preconditioner in Eq 2