中文

Anytime MiniBatch:利用掉队节点进行在线分布式优化

机器学习 2020-06-11 v1 分布式、并行与集群计算 最优化与控制 机器学习

摘要

分布式优化在解决大规模机器学习问题中至关重要。分布式优化技术的一个广泛共有特征是要求所有节点在每个计算轮次中完成其分配的任务,系统才能进入下一轮次。在此类设置中,被称为掉队节点(straggler)的慢节点会极大拖慢进度。为减轻掉队节点的影响,我们提出一种称为 Anytime Minibatch 的在线分布式优化方法。在该方法中,所有节点被给予固定时间来计算尽可能多数据样本的梯度。其结果是产生可变的每节点小批量大小。随后工作节点获得固定的通信时间,通过若干轮共识对其小批量梯度进行平均,然后用于通过双重平均更新原始变量。Anytime Minibatch 防止掉队节点拖住系统,同时不浪费掉队节点能够完成的工作。我们给出了收敛性分析并分析了挂钟时间性能。我们的数值结果表明,该方法在 Amazon EC2 上最高快 1.5 倍,而在计算节点性能差异更大时最高快五倍。

关键词

引用

@article{arxiv.2006.05752,
  title  = {Anytime MiniBatch: Exploiting Stragglers in Online Distributed Optimization},
  author = {Nuwan Ferdinand and Haider Al-Lawati and Stark C. Draper and Matthew Nokleby},
  journal= {arXiv preprint arXiv:2006.05752},
  year   = {2020}
}

备注

International Conference on Learning Representations (ICLR), May 2019, New Orleans, LA, USA