中文

超级计算环境下分布式深度学习Top-k梯度稀疏化的实证分析

机器学习 2022-09-20 v1 人工智能 分布式、并行与集群计算

摘要

为了更快地训练深度学习模型,近年来在多GPU上进行分布式训练是非常流行的方案。然而,通信带宽仍是训练性能的主要瓶颈。为提升整体训练性能,近期工作提出了显著减少通信流量的梯度稀疏化方法。其中多数需要对梯度排序以选取有意义的梯度,例如Top-k梯度稀疏化(Top-k SGD)。然而,Top-k SGD在提升整体训练性能加速比方面存在局限,因为梯度排序在GPU上效率极低。本文中,我们开展实验揭示了Top-k SGD的低效性,并提供了其低性能背后的洞察。基于实证分析中的观察,我们计划在未来工作中提出一种高性能的梯度稀疏化方法。

关键词

引用

@article{arxiv.2209.08497,
  title  = {Empirical Analysis on Top-k Gradient Sparsification for Distributed Deep Learning in a Supercomputing Environment},
  author = {Daegun Yoon and Sangyoon Oh},
  journal= {arXiv preprint arXiv:2209.08497},
  year   = {2022}
}

备注

4 pages, 4 figures, The 8th International Conference on Next Generation Computing (ICNGC) 2022