中文

缩小无放回 SGD 的收敛性差距

机器学习 2020-07-10 v6 最优化与控制 机器学习

摘要

无放回采样的随机梯度下降(SGD)在模型训练中被广泛使用。然而,绝大多数 SGD 分析假设数据是有放回采样的,且当所最小化函数强凸时,SGD 运行 TT 次迭代可建立 O(1T)\mathcal{O}\left(\frac{1}{T}\right) 的收敛速率。近期关于无放回 SGD(SGDo)的一系列突破性工作表明,当所最小化函数强凸且为 nn 个光滑函数之和时,收敛速率为 O(nT2)\mathcal{O}\left(\frac{n}{T^2}\right);对于二次函数之和,速率为 O(1T2+n3T3)\mathcal{O}\left(\frac{1}{T^2}+\frac{n^3}{T^3}\right)。另一方面,已知最紧的下界为 Ω(1T2+n2T3)\Omega\left(\frac{1}{T^2}+\frac{n^2}{T^3}\right),这为一般情形下更好的 SGDo 收敛速率留下了可能。本文弥合了这一差距,证明当函数之和为二次函数时,无放回 SGD 达到 O(1T2+n2T3)\mathcal{O}\left(\frac{1}{T^2}+\frac{n^2}{T^3}\right) 的速率,并针对作为光滑函数之和的强凸函数给出了 Ω(nT2)\Omega\left(\frac{n}{T^2}\right) 的新下界。

关键词

引用

@article{arxiv.2002.10400,
  title  = {Closing the convergence gap of SGD without replacement},
  author = {Shashank Rajput and Anant Gupta and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:2002.10400},
  year   = {2020}
}

备注

Simplified some proofs and fixed typos