S2 Reducer:面向分布式深度学习加速的高性能稀疏通信方法
分布式、并行与集群计算
2021-11-29 v2 人工智能
摘要
分布式随机梯度下降(SGD)方法已广泛应用于大规模深度学习,而梯度集合方法是保证分布式深度学习系统训练可扩展性的关键。AllReduce 等集合通信已被广泛采用以减少分布式 SGD 过程的通信时间。然而,AllReduce 消耗大量带宽资源,而在许多情况下大多数梯度是稀疏的,因为许多梯度值为零,应被高效压缩以节省带宽。为降低稀疏梯度通信开销,我们提出 Sparse-Sketch Reducer(S2 Reducer),一种具有收敛保证的基于 sketch 的稀疏梯度聚合方法。S2 Reducer 仅使用 count-sketch 和位图压缩非零梯度,从而降低通信成本,并实现高效的 AllReduce 算子用于并行 SGD 训练。我们在五种训练模型上与四种最先进方法进行了广泛评估。结果表明,与最先进方法相比,S2 Reducer 收敛至相同精度,减少 81% 的稀疏通信开销,并实现 1.8 加速。
引用
@article{arxiv.2110.02140,
title = {S2 Reducer: High-Performance Sparse Communication to Accelerate Distributed Deep Learning},
author = {Keshi Ge and Yongquan Fu and Zhiquan Lai and Xiaoge Deng and Dongsheng Li},
journal= {arXiv preprint arXiv:2110.02140},
year = {2021}
}
备注
10 pages, 8 figures