最优自适应加速随机梯度下降
机器学习
2018-10-02 v1 机器学习
摘要
随机梯度下降 (Sgd) 方法是训练机器学习和深度学习模型最强大的优化工具。此外,加速(亦称动量)方法与对角缩放(亦称自适应梯度)方法是改善 Sgd 缓慢收敛的两种主要技术。尽管实证研究已表明结合这两种技术的潜在优势,但尚不清楚这些方法能否达到随机优化的最优收敛速率。本文提出一类新的自适应加速随机梯度下降方法,并证明它们在随机优化中展现出最优的采样与迭代复杂度。更具体地,我们证明最初为改进朴素随机梯度而设计的对角缩放,可被纳入加速随机梯度下降中以在光滑随机优化中实现最优收敛速率。我们还证明动量除已知能加速确定性优化的收敛速率外,也为我们在随机优化中设计非均匀且激进的移动平均方案提供了新途径。最后,我们给出一些启发式方法,有助于实现自适应加速随机梯度下降方法并进一步提升其在机器学习和深度学习中的实际性能。
引用
@article{arxiv.1810.00553,
title = {Optimal Adaptive and Accelerated Stochastic Gradient Descent},
author = {Qi Deng and Yi Cheng and Guanghui Lan},
journal= {arXiv preprint arXiv:1810.00553},
year = {2018}
}