通过稀疏化和量化技术实现梯度压缩的高效分布式训练
机器学习
2025-02-12 v1 多媒体
摘要
本研究探讨了梯度压缩对分布式训练性能的影响,聚焦于稀疏化和量化技术,包括 top-k、DGC 和 QSGD。在基准实验中,随机-k 压缩导致严重的性能下降,凸显其无效性。相比之下,在 50 倍压缩比下使用 top-k 和 DGC 可实现性能提升,将困惑度最多降低 0.06。跨 1、2、4 个工作节点的实验表明,保守的稀疏化可对较小模型产生一定的正则化效果,而压缩比超过 5000 倍会显著损害性能,尤其是 DGC。所有压缩方法都显著降低了通信时间,尤其是 top-k 和 DGC 在高压缩比下可将通信时间降至可忽略水平。然而,top-k 因排序开销而增加计算时间,因而在可扩展性上不如 DGC 或 QSGD。在收敛测试中,稀疏化技术显示出加速收敛的效果,所需 epoch 数少于基准方法,这对计算资源节省具有意义。尽管出现精度权衡,浮点误差被压缩所缓解。本研究的发现凸显了为不同压缩技术获得最佳模型性能的必要性,尤其是在分布式训练系统中。
引用
@article{arxiv.2502.07634,
title = {Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques},
author = {Shruti Singh and Shantanu Kumar},
journal= {arXiv preprint arXiv:2502.07634},
year = {2025}
}