带动量随机梯度下降的改进分析
最优化与控制
2020-08-19 v2
摘要
带动量的 SGD(SGDM)已广泛应用于许多机器学习任务中,并且通常以分阶段方式调整动态步长和动量权重来使用。尽管 SGDM 相比 SGD 具有经验优势,但动量的一般作用仍不清楚,因为先前对 SGDM 的分析要么给出比 SGD 更差的收敛界,要么假设 Lipschitz 或二次目标,而这些在实践中并不成立。此外,动态参数的作用尚未得到探讨。在这项工作中,我们证明了在强凸和非凸设定下,SGDM 对光滑目标的收敛速度与 SGD 一样快。我们还建立了首个针对多阶段设定的收敛保证,并表明与使用固定参数相比,多阶段策略对 SGDM 更有利。最后,我们通过数值实验验证了这些理论结论。
引用
@article{arxiv.2007.07989,
title = {An Improved Analysis of Stochastic Gradient Descent with Momentum},
author = {Yanli Liu and Yuan Gao and Wotao Yin},
journal= {arXiv preprint arXiv:2007.07989},
year = {2020}
}