SGD在光滑插值范式下的快速后迭代收敛
机器学习
2025-07-29 v2 最优化与控制
机器学习
摘要
我们研究了针对光滑凸目标函数的随机梯度下降(SGD)的population收敛保证,在插值 regime中,该函数在最优处的噪声为零或接近零。近年来,特别是当使用较大(恒定)步长时,SGD在该设置下后迭代的行为受到日益关注,这与过参数化模型的训练、理解在续学习中的遗忘现象,以及分析求解线性系统的随机化Kaczmarz方法的收敛性都有关。我们证明,在步长为的-光滑凸损失函数上进行的步SGD后迭代的预期剩余风险为,其中表示在最优处的随机梯度方差。特别是,当选用良好调参的步长时,我们获得了接近最优的收敛率,扩展了Varre等人(2021)的实质结果,超出最小二乘回归的范围;当时,我们获得的收敛率,以为步长,优于Evron等人(2025)在可实现线性回归的特殊情况下最近建立的最佳已知收敛率。
引用
@article{arxiv.2507.11274,
title = {Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime},
author = {Amit Attia and Matan Schliserman and Uri Sherman and Tomer Koren},
journal= {arXiv preprint arXiv:2507.11274},
year = {2025}
}
备注
30 pages