中文

保持近最优梯度稀疏化代价以实现可扩展的分布式深度学习

机器学习 2024-02-22 v1 分布式、并行与集群计算

摘要

通信开销是扩展分布式训练系统的主要障碍。梯度稀疏化是一种在不显著损失模型保真度的情况下减少通信量的潜在优化方法。然而,现有的梯度稀疏化方法由于算法设计低效而具有较低的可扩展性,这显著增加了通信开销。特别是,梯度累积和不足的稀疏度控制方法极大地降低了稀疏化性能。此外,由于工作节点之间梯度选择的工作负载不平衡,通信流量急剧增加。为了应对这些挑战,我们提出了一种名为 ExDyna 的新型梯度稀疏化方案。在 ExDyna 中,模型的梯度张量由细粒度块组成,连续的块被分组为不重叠的分区。每个工作节点在其独占分配的分区中选择梯度,从而永远不会发生梯度累积。为了平衡工作节点之间梯度选择的工作负载,ExDyna 通过比较相邻分区的工作负载来调整分区拓扑。此外,ExDyna 支持在线阈值缩放,可即时估计梯度选择的准确阈值。因此,无论模型和数据集如何,ExDyna 都能在训练期间满足用户要求的稀疏度水平。因此,ExDyna 能够通过保持近最优的梯度稀疏化代价来增强分布式训练系统的可扩展性。在实验中,ExDyna 在训练速度和稀疏化性能方面均优于最先进的稀疏化器,同时实现了高准确率。

关键词

引用

@article{arxiv.2402.13781,
  title  = {Preserving Near-Optimal Gradient Sparsification Cost for Scalable Distributed Deep Learning},
  author = {Daegun Yoon and Sangyoon Oh},
  journal= {arXiv preprint arXiv:2402.13781},
  year   = {2024}
}

备注

24th IEEE/ACM International Symposium on Cluster, Cloud, and Internet Computing (CCGrid 2024). Code: https://github.com/kljp/exdyna