中文

稳定性边缘的SGD:大学习率的随机稳定化

机器学习 2026-06-29 v1 机器学习 最优化与控制

摘要

现代深度学习已被证明在稳定性边缘运行,常规使用的学习率远大于经典优化理论所证明的合理范围。先前对稳定性边缘现象的大多数分析集中在确定性梯度下降上,随机设置在很大程度上未被探索。在这项工作中,我们为应用于多类交叉熵损失的随机梯度下降(SGD)提供了尖锐的收敛保证,适用于线性分类器和两层神经网络。我们表明,SGD的随机性可能导致动力学在由曲率驱动振荡主导的边缘稳定性状态和期望损失以受控速率下降的稳定状态之间交替。尽管如此,我们证明了SGD自稳定动力学,确保迭代在固定数量的迭代内返回稳定,并允许即使在大学习率下也能以最佳迭代意义收敛。实验验证了我们的理论发现,并说明了SGD在大步长机制中的优势。

关键词

引用

@article{arxiv.2606.30930,
  title  = {SGD at the Edge of Stability: Stochastic Stabilization with Large Learning Rates},
  author = {Konstantinos Emmanouilidis and Lachlan MacDonald and Salma Tarmoun and Rene Vidal},
  journal= {arXiv preprint arXiv:2606.30930},
  year   = {2026}
}