自适应随机梯度下降的线性收敛性
机器学习
2020-06-23 v2 机器学习
最优化与控制
摘要
我们证明了自适应随机梯度方法的范数版本 (AdaGrad-Norm) 对于强凸函数的子集或满足 Polyak-Lojasiewicz (PL) 不等式的非凸函数子集均能达到线性收敛速率。本文引入了梯度受限一致不等式 (Restricted Uniform Inequality of Gradients, RUIG) 的概念——一种衡量随机梯度范数平衡性的指标——以描绘函数的景观。RUIG 在证明 AdaGrad-Norm 在随机环境下对超参数调优的鲁棒性方面起着关键作用。在 RUIG 的基础上,我们开发了一个两阶段框架,在无需知道目标函数参数的情况下证明了 AdaGrad-Norm 的线性收敛性。该框架很可能可以扩展到其他自适应步长算法。数值实验验证了该理论,并为未来的改进方向提供了启示。
引用
@article{arxiv.1908.10525,
title = {Linear Convergence of Adaptive Stochastic Gradient Descent},
author = {Yuege Xie and Xiaoxia Wu and Rachel Ward},
journal= {arXiv preprint arXiv:1908.10525},
year = {2020}
}