关于过参数化最小二乘问题中梯度下降在稳定边缘的收敛速率
机器学习
2025-10-21 v1 最优化与控制
摘要
经典优化理论保证在小步长或“稳定” regime 下使用梯度下降(GD)时目标函数单调递减。相比之下,神经网络上的梯度下降常在称为“稳定边缘”的大步长 regime 下进行,在该 regime 下目标函数随非单调减小,并观察到对平坦局部最小值存在隐式偏好。在本文中,我们致力于通过提供过参数化最小二乘设置下大学习率梯度下降的收敛速率来量化这一现象。我们分析的关键洞见是,由于过参数化,全局最小化集成形成黎曼流形 ,从而将 GD 动力学分解为沿 的分量和正交于 的分量。沿分量对应于目标锋利度上的黎曼梯度下降,而正交分量是一个分岔动力学系统。这一洞见使我们能够推导出三种由学习率大小特征的收敛速率:(a)亚临界 regime,在该 regime 下,暂时不稳定在有限时间内被克服,随后线性收敛至次优平坦全局最小值;(b)临界 regime,在该 regime 下,不稳定持续存在,呈幂律收敛至最优平坦全局最小值;(c)超临界 regime,在该 regime 下,不稳定持续存在,呈线性收敛至周期为两的轨道,位于最优平坦全局最小值中心。
引用
@article{arxiv.2510.17506,
title = {Convergence Rates for Gradient Descent on the Edge of Stability in Overparametrised Least Squares},
author = {Lachlan Ewen MacDonald and Hancheng Min and Leandro Palma and Salma Tarmoun and Ziqing Xu and René Vidal},
journal= {arXiv preprint arXiv:2510.17506},
year = {2025}
}
备注
NeurIPS2025. Code available at https://github.com/lemacdonald/eos-convergence-rates-codimension-1