中文

分布式深度学习中压缩通信的理论分析与实用实现之间的差异

分布式、并行与集群计算 2019-11-20 v1 机器学习 最优化与控制

摘要

压缩通信以随机梯度稀疏化或量化的形式,被用于降低深度神经网络分布式数据并行训练中的通信开销。然而,理论与实践之间存在差异:现有大多数压缩方法的理论分析假设压缩应用于整个模型的梯度,而许多实际实现是对模型每一层的梯度分别进行操作。本文证明,在理论上逐层压缩更优,因为在广泛的偏置与非偏置压缩方法下,其收敛速率的上界不超过整个模型压缩的收敛速率。然而,尽管有理论界,我们对六种知名方法的实验研究表明,在实际中收敛是否更优取决于实际训练的模型与压缩比。我们的发现表明,深度学习框架同时支持逐层压缩与整个模型压缩将是有利的。

关键词

引用

@article{arxiv.1911.08250,
  title  = {On the Discrepancy between the Theoretical Analysis and Practical Implementations of Compressed Communication for Distributed Deep Learning},
  author = {Aritra Dutta and El Houcine Bergou and Ahmed M. Abdelmoniem and Chen-Yu Ho and Atal Narayan Sahu and Marco Canini and Panos Kalnis},
  journal= {arXiv preprint arXiv:1911.08250},
  year   = {2019}
}

备注

To Appear In Proceedings of Thirty-Fourth AAAI Conference on Artificial Intelligence, 2020