小学习率 SGD 中动量的边际价值
机器学习
2024-04-17 v2 最优化与控制
摘要
已知在无随机梯度噪声的强凸设定下,动量可加速梯度下降的收敛。在随机优化中,例如神经网络训练,经验认为动量可能通过减小随机梯度更新的方差来帮助深度学习优化,但以往的理论分析并未发现动量能提供任何可证明的加速。本文的理论结果阐明了在学习率较小且梯度噪声是不稳定性的主要来源这类随机设定中动量的作用,表明带与不带动量的 SGD 在短时间与长时间尺度上表现相似。实验表明,在最优学习率不太大的实际训练机制中(包括在 ImageNet 上从头进行小到中等批量训练,以及在下游任务上微调语言模型),动量对优化与泛化的益处确实有限。
引用
@article{arxiv.2307.15196,
title = {The Marginal Value of Momentum for Small Learning Rate SGD},
author = {Runzhe Wang and Sadhika Malladi and Tianhao Wang and Kaifeng Lyu and Zhiyuan Li},
journal= {arXiv preprint arXiv:2307.15196},
year = {2024}
}