Caramel:通过计算调度加速去中心化分布式深度学习
网络与互联网体系结构
2020-04-30 v1 分布式、并行与集群计算
机器学习
摘要
在深度神经网络(DNN)训练这一网络密集型任务中,参数聚合的首选方法正从参数服务器模型转向受更优性能理论保证启发的去中心化聚合方案(AllReduce)。然而,当前 AllReduce 的实现忽视了通信与计算的相互依赖,导致显著的性能下降。在本文中,我们开发了 Caramel,一个通过模型感知的计算调度和针对 AllReduce 的通信优化来加速去中心化分布式深度学习的系统。Caramel 通过以下方式实现该目标:(a)扩展每个参数传输可行窗口(传输边界)的计算 DAG 调度;(b)用于平滑负载的网络优化,包括自适应批处理和参数传输的流水线化。Caramel 保持数据流模型的正确性,与硬件无关,且不需要任何用户级或框架级更改。我们在 TensorFlow 上实现 Caramel,并表明在云环境中 DNN 训练的迭代时间最多可提升 3.62 倍。
引用
@article{arxiv.2004.14020,
title = {Caramel: Accelerating Decentralized Distributed Deep Learning with Computation Scheduling},
author = {Sayed Hadi Hashemi and Sangeetha Abdu Jyothi and Brighten Godfrey and Roy Campbell},
journal= {arXiv preprint arXiv:2004.14020},
year = {2020}
}