具有更低通信复杂度的方差缩减局部 SGD
机器学习
2020-01-01 v1 分布式、并行与集群计算
最优化与控制
机器学习
摘要
为加速机器学习模型训练,分布式随机梯度下降(SGD)及其变体已被广泛采用,其利用多个工作节点并行以加快训练。其中,局部 SGD 因其较低通信成本而备受关注。然而,当工作节点上数据分布非独立同分布时,局部 SGD 需要 次通信来维持其\emph{线性迭代加速}性质,其中 为总迭代次数, 为工作节点数。本文提出方差缩减局部 SGD (VRL-SGD) 以进一步降低通信复杂度。得益于消除了对工作节点间梯度方差的依赖,我们从理论上证明 VRL-SGD 即使在各工作节点访问非独立同分布数据集时,也能以更低通信复杂度 实现\emph{线性迭代加速}。我们在三项机器学习任务上开展实验,实验结果表明当工作节点间数据高度异构时,VRL-SGD 表现明显优于局部 SGD。
引用
@article{arxiv.1912.12844,
title = {Variance Reduced Local SGD with Lower Communication Complexity},
author = {Xianfeng Liang and Shuheng Shen and Jingchang Liu and Zhen Pan and Enhong Chen and Yifei Cheng},
journal= {arXiv preprint arXiv:1912.12844},
year = {2020}
}
备注
25 pages, 6 figures. The paper presents a novel variance reduction algorithm for Local SGD