中文

DropCompute:通过计算方差缩减实现简单且更鲁棒的分布式同步训练

机器学习 2023-09-26 v2

摘要

背景:分布式训练对于深度神经网络(DNNs)的大规模训练至关重要。大规模DNN训练的主流方法是同步的(例如All-Reduce),但这些方法在每一步都需要等待所有工作节点。因此,这些方法受到掉队工作节点所导致延迟的限制。结果:我们研究了一种典型场景,其中工作节点由于计算时间的可变性而掉队。我们发现了由此类掉队工作节点引起的计算时间特性与可扩展性限制之间的解析关系。基于这些发现,我们提出了一种简单而有效的去中心化方法来减少工作节点间的差异,从而改善同步训练的鲁棒性。该方法可与广泛使用的All-Reduce集成。我们的发现在使用200个Gaudi加速器的大规模训练任务上得到了验证。

关键词

引用

@article{arxiv.2306.10598,
  title  = {DropCompute: simple and more robust distributed synchronous training via compute variance reduction},
  author = {Niv Giladi and Shahar Gottlieb and Moran Shkolnik and Asaf Karnieli and Ron Banner and Elad Hoffer and Kfir Yehuda Levy and Daniel Soudry},
  journal= {arXiv preprint arXiv:2306.10598},
  year   = {2023}
}

备注

https://github.com/paper-submissions/dropcompute