非凸优化中(裁剪)SGD 的紧长期尾部衰减
机器学习
2026-02-06 v1 最优化与控制
摘要
关于 SGD 诱导过程尾部行为的研究正引起广泛关注,因为它能提供关于单个算法运行的强有力保证。虽然许多作品提供高概率保证,量化固定概率阈值的误差率,但缺乏直接研究失败概率的工作,即量化固定误差阈值的尾部衰减率。此外,现有结果是有限时隅的,限制了其捕捉真正长期尾部衰减的能力,这对通常进行数百万次迭代训练的现代学习模型更为重要。我们的工作通过大偏差理论的视角研究 SGD 方法的长期尾部衰减,在此过程中建立了几个强有力的结果。首先,我们提供了关于 vanilla SGD 最佳迭代项梯度范数平方尾部的上界,针对非凸成本和有界噪声,具有 级别的长期衰减。接下来,我们通过考虑在重尾噪声下的裁剪 SGD (c-SGD),其中噪声的 moments 有界阶数 ,给出上界,具有 级别的长期衰减,其中 对于 ,以及 对于 。最后,我们提供尾部衰减的下界,衰减率为 ,表明我们的 SGD 和 c-SGD 的结果在多项对数因子上是紧的。值得注意的是,我们的结果显示,与基于有限时隅界限的现有工作相比,后者显示出约一个数量级更快的长期尾部衰减,这些工作显示衰减率为 和 ,,分别针对 SGD 和 c-SGD。因此,我们发现尾部衰减远快于之前已知的情形,为单个运行提供更强的长期保证。
引用
@article{arxiv.2602.05657,
title = {Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization},
author = {Aleksandar Armacki and Dragana Bajović and Dušan Jakovetić and Soummya Kar and Ali H. Sayed},
journal= {arXiv preprint arXiv:2602.05657},
year = {2026}
}
备注
32 pages