中文

ScaleCom:面向通信高效分布式训练的可扩展稀疏化梯度压缩

机器学习 2021-04-23 v1

摘要

在最先进的平台上大规模分布式训练深度神经网络(DNNs)预计将受到严重的通信限制。为克服这一限制,人们提出了大量梯度压缩技术,并展示了高压缩比。然而,大多数现有方法不能很好地扩展到大规模分布式系统(由于梯度累积),和/或未能在大型数据集上评估模型保真度(测试精度)。为缓解这些问题,我们提出了一种新的压缩技术——可扩展稀疏化梯度压缩(ScaleCom),它利用学习者之间梯度分布的相似性来显著改善可扩展性。通过理论分析,我们表明 ScaleCom 提供了良好的收敛保证,并且与梯度 all-reduce 技术兼容。此外,我们通过实验证明,ScaleCom 开销小,直接减少梯度流量,并在广泛的应用(图像、语言和语音)中提供高压缩率(65-400倍)和优异的可扩展性(最多 64 个学习者和比标准训练大 8-12 倍的批大小),且没有显著的精度损失。

关键词

引用

@article{arxiv.2104.11125,
  title  = {ScaleCom: Scalable Sparsified Gradient Compression for Communication-Efficient Distributed Training},
  author = {Chia-Yu Chen and Jiamin Ni and Songtao Lu and Xiaodong Cui and Pin-Yu Chen and Xiao Sun and Naigang Wang and Swagath Venkataramani and Vijayalakshmi Srinivasan and Wei Zhang and Kailash Gopalakrishnan},
  journal= {arXiv preprint arXiv:2104.11125},
  year   = {2021}
}

备注

NeurIPS2020 accepted https://proceedings.neurips.cc/paper/2020/hash/9d58963592071dbf38a0fa114269959c-Abstract.html