中文

Minibatch 与局部 SGD 带重排的紧收敛界及超越

机器学习 2022-03-24 v2 最优化与控制 机器学习

摘要

在分布式学习中,局部 SGD(亦称联邦平均)及其简单基线 minibatch SGD 是被广泛研究的优化方法。现有对这些方法的分析大多假设通过有放回采样获得独立无偏梯度估计。相反,我们研究基于重排的变体:minibatch 与局部 Random Reshuffling,它们无放回抽取随机梯度,因而更贴近实践。对于满足 Polyak-{\L}ojasiewicz 条件的光滑函数,我们得到(在大 epoch regime)收敛界,表明这些基于重排的变体比其有放回对应方法收敛更快。此外,我们证明匹配下界,表明我们的收敛分析是紧的。最后,我们提出一种称为同步重排的算法修正,在近似同构设定下可取得快于我们下界的收敛速率。

关键词

引用

@article{arxiv.2110.10342,
  title  = {Minibatch vs Local SGD with Shuffling: Tight Convergence Bounds and Beyond},
  author = {Chulhee Yun and Shashank Rajput and Suvrit Sra},
  journal= {arXiv preprint arXiv:2110.10342},
  year   = {2022}
}

备注

ICLR 2022 camera-ready (selected for an oral presentation); 76 pages, 3 figures