中文

SGD在光滑插值范式下的快速后迭代收敛

机器学习 2025-07-29 v2 最优化与控制 机器学习

摘要

我们研究了针对光滑凸目标函数的随机梯度下降(SGD)的population收敛保证,在插值 regime中,该函数在最优处的噪声为零或接近零。近年来,特别是当使用较大(恒定)步长时,SGD在该设置下后迭代的行为受到日益关注,这与过参数化模型的训练、理解在续学习中的遗忘现象,以及分析求解线性系统的随机化Kaczmarz方法的收敛性都有关。我们证明,在步长为0<η<2/β0 < \eta < 2/\betaβ\beta-光滑凸损失函数上进行的T T 步SGD后迭代的预期剩余风险为O~(1η(2βη)T1βη/2+η(2βη)2Tβη/2σ2)\widetilde{O}(\frac{1}{\eta (2-\beta \eta) T^{1-\beta\eta/2}} + \frac{\eta}{(2-\beta\eta)^2} T^{\beta\eta/2} \sigma_\star^2),其中σ2\sigma_\star^2表示在最优处的随机梯度方差。特别是,当选用良好调参的步长时,我们获得了接近最优的O~(1/T+σ/T)\widetilde{O}(1/T + \sigma_\star/\sqrt{T})收敛率,扩展了Varre等人(2021)的实质结果,超出最小二乘回归的范围;当σ=0\sigma_\star=0时,我们获得O(1/T)\smash{O(1/\sqrt T)}的收敛率,以η=1/β\eta=1/\beta为步长,优于Evron等人(2025)在可实现线性回归的特殊情况下最近建立的O(T1/4)\smash{O(T^{-1/4})}最佳已知收敛率。

关键词

引用

@article{arxiv.2507.11274,
  title  = {Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime},
  author = {Amit Attia and Matan Schliserman and Uri Sherman and Tomer Koren},
  journal= {arXiv preprint arXiv:2507.11274},
  year   = {2025}
}

备注

30 pages