中文

MiCRO:用于扩展和加速分布式 DNN 训练的近零成本梯度稀疏化方法

机器学习 2024-02-21 v3 分布式、并行与集群计算

摘要

梯度稀疏化是一种用于扩展和加速分布式深度神经网络(DNN)训练的通信优化技术。它减少了梯度聚合中不断增长的通信流量。然而,现有的稀疏化器由于梯度选择的高计算成本和/或通信流量的增加而导致可扩展性差。特别地,通信流量的增加是由梯度累积和梯度选择的不当阈值引起的。为了解决这些挑战,我们提出了一种称为 MiCRO 的新型梯度稀疏化方法。在 MiCRO 中,梯度向量被划分,每个分区分配给相应的工作节点。然后每个工作节点从其分区中选择梯度,聚合后的梯度不存在梯度累积。此外,MiCRO 通过最小化压缩比误差来估计准确的阈值,以根据用户需求维持通信流量。MiCRO 通过解决阻碍分布式 DNN 训练可扩展性和加速的现有问题,实现了近零成本的梯度稀疏化。在我们的大量实验中,MiCRO 以出色的收敛速度优于最先进的稀疏化器。

关键词

引用

@article{arxiv.2310.00967,
  title  = {MiCRO: Near-Zero Cost Gradient Sparsification for Scaling and Accelerating Distributed DNN Training},
  author = {Daegun Yoon and Sangyoon Oh},
  journal= {arXiv preprint arXiv:2310.00967},
  year   = {2024}
}

备注

30th IEEE International Conference on High Performance Computing, Data, and Analytics (HiPC 2023). Code: https://github.com/kljp/micro