通过梯度平均策略能否将随机梯度方法的收敛速率加速至 $\mathcal{O}(1/k^2)$?
最优化与控制
2020-02-26 v1 机器学习
数值分析
数值分析
摘要
本文中我们考量是否可能应用梯度平均策略,在不增加任何存储的情况下改进次线性收敛速率。我们的分析揭示,肯定的答案需要恰当的均值策略以及满足方差主导条件的迭代。作为一个有趣的事实,我们表明,若我们所定义的迭代方差在随机梯度迭代中始终哪怕仅略微占优,则所提出的梯度平均策略能以概率将强凸且具 Lipschitz 梯度的目标函数的收敛速率由 提升至 。该结论提示我们应怎样控制随机梯度迭代以改善收敛速率。
引用
@article{arxiv.2002.10769,
title = {Can speed up the convergence rate of stochastic gradient methods to $\mathcal{O}(1/k^2)$ by a gradient averaging strategy?},
author = {Xin Xu and Xiaopeng Luo},
journal= {arXiv preprint arXiv:2002.10769},
year = {2020}
}
备注
20 pages, 1 figure