中文

重新审视随机梯度方法的末次迭代收敛性

机器学习 2026-03-20 v4 最优化与控制 机器学习

摘要

在过去几年中,随机梯度下降 (SGD) 算法的末次迭代收敛性因其良好的实际表现但缺乏理论理解而引发了人们的兴趣。对于 Lipschitz 凸函数,不同的工作已经为最终迭代建立了最优的 O(log(1/δ)logT/T)O(\log(1/\delta)\log T/\sqrt{T})O(log(1/δ)/T)O(\sqrt{\log(1/\delta)/T}) 高概率收敛速率,其中 T 是时间跨度,\delta 是失败概率。然而,为了证明这些界限,所有现有工作要么局限于紧致域,要么要求几乎必然有界的噪声。一个自然的问题是,SGD 的末次迭代是否仍能保证最优收敛速率,但无需这两个限制性假设。除了这个重要问题之外,仍有许多理论问题缺乏答案。例如,与 SGD 在非光滑问题上的末次迭代收敛性相比,针对光滑优化仅开发了少量结果。此外,现有结果均局限于非复合目标和标准欧几里得范数。末次迭代收敛性是否可以证明可推广到更一般的复合优化和非欧几里得范数仍不清楚。在这项工作中,为了解决上述问题,我们重新审视了随机梯度方法的末次迭代收敛性,并提供了首个统一的证明方法,以同时适应一般域、复合目标、非欧几里得范数、Lipschitz 条件、光滑性和 (强) 凸性,证明期望和高概率下的收敛速率。此外,我们将分析扩展到在重尾和次 Weibull 噪声下获得末次迭代收敛性。

关键词

引用

@article{arxiv.2312.08531,
  title  = {Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods},
  author = {Zijian Liu and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2312.08531},
  year   = {2026}
}

备注

The preliminary version has been accepted at ICLR 2024. For the update history, please refer to the PDF