中文

非线性随机梯度下降与重尾噪声:统一框架与高概率保证

机器学习 2025-03-24 v2 最优化与控制

摘要

我们研究在存在重尾噪声的情况下的在线学习中的高概率收敛。为抵御重尾噪声,考虑一种一般化的非线性 SGD 方法,包含 sign、量化、分量级和联合裁剪等多种常见非线性函数。在我们的工作中,非线性被以黑盒方式处理,使我们能够为广泛的非线性方法建立统一保证。对于对称噪声和非凸成本,我们建立梯度范数平方的收敛,收敛率为 O~(t1/4)\widetilde{\mathcal{O}}(t^{-1/4});对于强凸成本的最后一次迭代,我们建立收敛至 population optima 的收敛,收敛率为 O(tζ)\mathcal{O}(t^{-\zeta}),其中 ζ(0,1)\zeta \in (0,1) 取决于噪声和问题参数。进一步地,若噪声为对称和非对称成分的(有偏)混合,则我们显示收敛至平稳性邻域,邻域大小取决于混合系数、非线性和噪声。与现有方法相比,后者仅考虑裁剪且要求噪声无偏且具有有限 pp 阶矩,p(1,2]p \in (1,2];我们为广泛的非线性类别提供保证,且不对噪声矩作任何假设。尽管现有方法的收敛指数取决于噪声矩且随 p1p \rightarrow 1 消失,但我们的指数为常数,且在非凸情形下 p<6/5p < 6/5,在强凸情形下 p<8/7p < 8/7 时均严格更好。实验验证了我们的理论,表明裁剪并非总是最佳非线性,进一步凸显了通用框架的价值。

关键词

引用

@article{arxiv.2410.13954,
  title  = {Nonlinear Stochastic Gradient Descent and Heavy-tailed Noise: A Unified Framework and High-probability Guarantees},
  author = {Aleksandar Armacki and Shuhua Yu and Pranay Sharma and Gauri Joshi and Dragana Bajovic and Dusan Jakovetic and Soummya Kar},
  journal= {arXiv preprint arXiv:2410.13954},
  year   = {2025}
}

备注

40 pages, 6 figures