随机重排在有限轮次后优于SGD
最优化与控制
2019-10-09 v2 机器学习
摘要
随机梯度下降(SGD)理论中一个长期存在的问题是证明其与不放回版本RandomShuffle相比收敛更快。我们给出了该问题首个(据我们所知)非渐近解,表明在经过“合理”数量的轮次后,RandomShuffle确实比SGD收敛更快。具体而言,我们证明在强凸性与二阶光滑性下,RandomShuffle生成的序列以O(1/T^2 + n^3/T^3)的速率收敛到最优解,其中n为目标函数中分量的个数,T为总迭代次数。该结果表明,在经过合理数量的轮次后,RandomShuffle严格优于SGD(其收敛速率为O(1/T))。证明这种对T更好依赖关系的关键一步是在界中引入n;并且正如我们的分析所示,一般而言,若不对算法做进一步改动,n的依赖是不可避免的。我们证明对于稀疏数据,RandomShuffle具有O(1/T^2)的速率,同样严格优于SGD。此外,我们讨论了向非凸梯度主导函数以及非强凸情形的推广。
引用
@article{arxiv.1806.10077,
title = {Random Shuffling Beats SGD after Finite Epochs},
author = {Jeff Z. HaoChen and Suvrit Sra},
journal= {arXiv preprint arXiv:1806.10077},
year = {2019}
}