理解分布式深度学习中的 Top-k 稀疏化
机器学习
2019-11-21 v1 分布式、并行与集群计算
机器学习
摘要
分布式随机梯度下降(SGD)算法被广泛用于训练大规模深度学习模型,而工作节点间的通信开销成为新的系统瓶颈。近期提出的梯度稀疏化技术,尤其是带误差补偿的 Top- 稀疏化(TopK-SGD),能在不明显影响模型精度的前提下显著减少通信流量。已有一些理论研究分析了 TopK-SGD 的收敛性质。然而,现有研究未深入梯度稀疏化中 Top- 算子的细节,而采用宽松的界(例如 Random- 的精确界)进行分析;因此所得结果不能很好地描述 TopK-SGD 真实的收敛表现。为此,我们首先通过大量实验研究了 TopK-SGD 训练过程中的梯度分布。随后,我们从理论上推导了 Top- 算子更紧的界。最后,我们利用梯度分布的特性提出了一种近似 top- 选择算法,该算法对 GPU 计算高效,可通过显著降低计算开销来提升 TopK-SGD 的扩展效率。代码见:\url{https://github.com/hclhkbu/GaussianK-SGD}。
引用
@article{arxiv.1911.08772,
title = {Understanding Top-k Sparsification in Distributed Deep Learning},
author = {Shaohuai Shi and Xiaowen Chu and Ka Chun Cheung and Simon See},
journal= {arXiv preprint arXiv:1911.08772},
year = {2019}
}
备注
14 pages