随机重排下的随机梯度下降表现如何
机器学习
2021-06-03 v4 最优化与控制
机器学习
摘要
我们研究随机梯度下降(SGD)在光滑且强凸的有限和优化问题上的性能。与现有多数理论工作假设个体函数被有放回地采样不同,我们在此关注流行但理解甚少的一些启发式方法,这些方法涉及遍历个体函数的随机排列。该设置已在近期若干工作中被研究,但最优误差率仍不清楚。在本文中,我们给出了使用这些启发式方法(采用任意常数步长的 SGD)时期望优化误差的下界,阐明了它们的优点与缺点。特别地,我们证明在对 个个体函数进行 遍遍历后,若每遍之后重新打乱函数顺序,SGD 的最佳可能优化误差至少为 ,这部分对应于近期推导出的上界。此外,若仅打乱一次函数顺序,则下界增大至 。由于重复重排存在严格更小的上界,这证明了单次重排与重复重排的 SGD 之间存在固有的性能差距。作为一个较次要的贡献,我们还给出了当不进行随机重排时,增量梯度方法的非渐近 下界(与 无关)。最后,我们通过证明单变量二次函数上的匹配上界,给出了我们的下界是紧的指示。
引用
@article{arxiv.1908.00045,
title = {How Good is SGD with Random Shuffling?},
author = {Itay Safran and Ohad Shamir},
journal= {arXiv preprint arXiv:1908.00045},
year = {2021}
}