中文

非凸优化中(裁剪)SGD 的紧长期尾部衰减

机器学习 2026-02-06 v1 最优化与控制

摘要

关于 SGD 诱导过程尾部行为的研究正引起广泛关注,因为它能提供关于单个算法运行的强有力保证。虽然许多作品提供高概率保证,量化固定概率阈值的误差率,但缺乏直接研究失败概率的工作,即量化固定误差阈值的尾部衰减率。此外,现有结果是有限时隅的,限制了其捕捉真正长期尾部衰减的能力,这对通常进行数百万次迭代训练的现代学习模型更为重要。我们的工作通过大偏差理论的视角研究 SGD 方法的长期尾部衰减,在此过程中建立了几个强有力的结果。首先,我们提供了关于 vanilla SGD 最佳迭代项梯度范数平方尾部的上界,针对非凸成本和有界噪声,具有 et/log(t)e^{-t/\log(t)} 级别的长期衰减。接下来,我们通过考虑在重尾噪声下的裁剪 SGD (c-SGD),其中噪声的 moments 有界阶数 p(1,2]p \in (1,2],给出上界,具有 etβp/log(t)e^{-t^{\beta_p}/\log(t)} 级别的长期衰减,其中 βp=4(p1)3p2\beta_p = \frac{4(p-1)}{3p-2} 对于 p(1,2)p \in (1,2),以及 et/log2(t)e^{-t/\log^2(t)} 对于 p=2p = 2。最后,我们提供尾部衰减的下界,衰减率为 ete^{-t},表明我们的 SGD 和 c-SGD 的结果在多项对数因子上是紧的。值得注意的是,我们的结果显示,与基于有限时隅界限的现有工作相比,后者显示出约一个数量级更快的长期尾部衰减,这些工作显示衰减率为 ete^{-\sqrt{t}}etβp/2e^{-t^{\beta_p/2}}p(1,2]p \in (1,2],分别针对 SGD 和 c-SGD。因此,我们发现尾部衰减远快于之前已知的情形,为单个运行提供更强的长期保证。

关键词

引用

@article{arxiv.2602.05657,
  title  = {Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization},
  author = {Aleksandar Armacki and Dragana Bajović and Dušan Jakovetić and Soummya Kar and Ali H. Sayed},
  journal= {arXiv preprint arXiv:2602.05657},
  year   = {2026}
}

备注

32 pages