中文

利用无损同态压缩加速分布式深度学习

分布式、并行与集群计算 2024-02-13 v1 数据结构与算法 机器学习 网络与互联网体系结构

摘要

随着深度神经网络 (DNNs) 的复杂性和规模不断增长,分布式训练期间的通信开销随之增加,已成为一个显著的瓶颈,挑战着分布式训练系统的可扩展性。现有的解决方案旨在通过工作节点级压缩和网络内聚合来缓解这一瓶颈,但由于无法有效协调压缩效果与计算开销之间的权衡,导致整体性能和可扩展性受阻。在本文中,我们引入了一种新颖的压缩算法,有效地将工作节点级压缩与网络内聚合相结合。我们的解决方案既是同态的,允许在不进行 CPU/GPU 处理的情况下进行高效的网络内聚合,又是无损的,确保训练精度不受损害。我们的方法在理论和计算效率上均达到最优,并在 NCF、LSTM、VGG19 和 BERT-base 等多种 DNN 模型上进行了实证验证,结果显示聚合吞吐量提高了高达 6.33×\times,每次迭代的训练速度提高了 3.74×\times

关键词

引用

@article{arxiv.2402.07529,
  title  = {Accelerating Distributed Deep Learning using Lossless Homomorphic Compression},
  author = {Haoyu Li and Yuchen Xu and Jiayi Chen and Rohit Dwivedula and Wenfei Wu and Keqiang He and Aditya Akella and Daehyeok Kim},
  journal= {arXiv preprint arXiv:2402.07529},
  year   = {2024}
}