裁剪改善 Adam-Norm 和 AdaGrad-Norm 当噪声为重尾分布时
机器学习
2025-08-15 v3 最优化与控制
摘要
具有自适应步长的方法,如 AdaGrad 和 Adam,是训练现代深度学习模型(尤其是大型语言模型)的必备工具。通常情况下,后者的随机梯度噪声为重尾分布。梯度裁剪可在此类噪声下实现良好的高概率收敛。然而,尽管 AdaGrad/Adam 与 Clip-SGD 在结构上相似,当前对 AdaGrad/Adam 类方法在此情况下的高概率收敛理解仍有限。本文证明,如果噪声为重尾分布,AdaGrad/Adam(及其延迟版本)可能出现严重的高概率收敛差异。我们还展示,梯度裁剪可解决此问题,即我们推导了针对 AdaGrad-Norm 和 Adam-Norm(带裁剪及/或延迟)在光滑凸/非凸随机优化中处理重尾噪声时,具有多对数置信水平依赖性的新型高概率收敛界限。我们将结果推广至带延迟步长的 AdaGrad/Adam。我们的实验结果突显了裁剪后的 AdaGrad/Adam 在处理重尾噪声方面的优势。
引用
@article{arxiv.2406.04443,
title = {Clipping Improves Adam-Norm and AdaGrad-Norm when the Noise Is Heavy-Tailed},
author = {Savelii Chezhegov and Yaroslav Klyukin and Andrei Semenov and Aleksandr Beznosikov and Alexander Gasnikov and Samuel Horváth and Martin Takáč and Eduard Gorbunov},
journal= {arXiv preprint arXiv:2406.04443},
year = {2025}
}
备注
ICML 2025. 65 pages, 12 figures. Changes in V3: extended results for the methods with coordinate-wise stepsizes and new experiments