中文

自适应重尾随机梯度下降

机器学习 2025-09-01 v1 人工智能

摘要

在大规模神经网络模型时代,优化算法常因过度依赖训练损失而在泛化能力上困扰。一个关键见解被广泛接受是,宽边缘(局部最小值周围损失逐渐增加的区域)通过为小输入数据或模型参数的微小变化提供更大的稳定性来促进更好的泛化。相比之下,锐利的最小值通常更敏感且不够稳定。基于两个关键经验观察——随机梯度下降中梯度噪声的固有重尾分布以及神经网络训练中在稳定性边缘现象(即曲率在到达平台前增大),我们引入自适应重尾随机梯度下降(AHTSGD)。该算法在训练早期注入更重尾的噪声以增强探索,并逐渐过渡到更轻尾的噪声以稳定锐利性。通过动态适应训练期间损失景观的锐利程度,AHTSGD 促进快速收敛到宽边缘。AHTSGD 是首个基于稳定性边缘现象调整优化器中注入噪声性质的算法。在 MNIST 和 CIFAR-10 等基准测试上,AHTSGD 持续优于 SGD 和其他基于噪声的方法,在 SVHN 等噪声数据集上表现尤为突出。它最终加速了来自差异初始化的早期训练,并在干净和噪声设置下提升泛化能力,同时对学习率选择保持鲁棒性。

关键词

引用

@article{arxiv.2508.21353,
  title  = {Adaptive Heavy-Tailed Stochastic Gradient Descent},
  author = {Bodu Gong and Gustavo Enrique Batista and Pierre Lafaye de Micheaux},
  journal= {arXiv preprint arXiv:2508.21353},
  year   = {2025}
}