自稳定:稳定性边缘处梯度下降的隐式偏置
机器学习
2023-04-12 v2 信息论
math.IT
最优化与控制
机器学习
摘要
对梯度下降的传统分析表明,当 Hessian 矩阵的最大特征值(也称为锐度 )以 为界时,训练是“稳定”的,且训练损失单调下降。然而,最近的工作观察到,在使用全批量或大批量的梯度下降训练现代神经网络时,这一假设并不成立。最近,Cohen 等人(2021)观察到了两个重要现象。第一个被称为渐进锐化,即锐度在整个训练过程中稳步增加,直到达到不稳定性临界值 。第二个被称为稳定性边缘,即锐度在训练的剩余时间里徘徊在 ,而损失继续下降,尽管是非单调的。我们证明,远非混沌,稳定性边缘处梯度下降的动力学可以由三次泰勒展开刻画:由于不稳定性,迭代沿 Hessian 矩阵主特征向量的方向发散,损失函数局部泰勒展开中的三次项使曲率减小,直到恢复稳定。这一性质,我们称之为自稳定,是梯度下降的普遍性质,并解释了其在稳定性边缘处的行为。自稳定的一个关键后果是,在约束 下,稳定性边缘处的梯度下降隐式地遵循投影梯度下降(PGD)。我们的分析对训练全过程中的损失、锐度以及与 PGD 轨迹的偏差给出了精确预测,并在多个标准设置中通过实验以及在温和条件下通过理论进行了验证。我们的分析揭示了梯度下降朝向稳定性的隐式偏置的机制。
引用
@article{arxiv.2209.15594,
title = {Self-Stabilization: The Implicit Bias of Gradient Descent at the Edge of Stability},
author = {Alex Damian and Eshaan Nichani and Jason D. Lee},
journal= {arXiv preprint arXiv:2209.15594},
year = {2023}
}
备注
ICLR 2023, first two authors contributed equally