异构分布式学习中的小批量与局部 SGD 对比
机器学习
2022-03-02 v5 最优化与控制
机器学习
摘要
我们分析异构分布式设定下的局部 SGD(亦称并行或联邦 SGD)与小批量 SGD,其中每台机器可访问针对不同且机器特有的凸目标函数的随机梯度估计;目标是关于平均目标函数进行优化;且机器只能间歇性通信。我们论证:(i)在此设定下小批量 SGD(即便无加速)优于局部 SGD 的所有现有分析,(ii)当异构性高时加速小批量 SGD 是最优的,以及(iii)给出首个在非齐次机制下优于小批量 SGD 的局部 SGD 上界。
引用
@article{arxiv.2006.04735,
title = {Minibatch vs Local SGD for Heterogeneous Distributed Learning},
author = {Blake Woodworth and Kumar Kshitij Patel and Nathan Srebro},
journal= {arXiv preprint arXiv:2006.04735},
year = {2022}
}
备注
34 pages