缩小无放回 SGD 的收敛性差距
机器学习
2020-07-10 v6 最优化与控制
机器学习
摘要
无放回采样的随机梯度下降(SGD)在模型训练中被广泛使用。然而,绝大多数 SGD 分析假设数据是有放回采样的,且当所最小化函数强凸时,SGD 运行 次迭代可建立 的收敛速率。近期关于无放回 SGD(SGDo)的一系列突破性工作表明,当所最小化函数强凸且为 个光滑函数之和时,收敛速率为 ;对于二次函数之和,速率为 。另一方面,已知最紧的下界为 ,这为一般情形下更好的 SGDo 收敛速率留下了可能。本文弥合了这一差距,证明当函数之和为二次函数时,无放回 SGD 达到 的速率,并针对作为光滑函数之和的强凸函数给出了 的新下界。
引用
@article{arxiv.2002.10400,
title = {Closing the convergence gap of SGD without replacement},
author = {Shashank Rajput and Anant Gupta and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:2002.10400},
year = {2020}
}
备注
Simplified some proofs and fixed typos