GraVAC:面向通信高效分布式深度学习训练的自适应压缩
机器学习
2024-01-30 v2
摘要
分布式数据并行(DDP)训练通过多设备对数据子集进行训练并聚合更新以产生全局共享模型,从而提升整体应用吞吐量。每次迭代的周期性同步带来了可观的开销,且因最先进神经网络规模和复杂度的增长而加剧。尽管许多梯度压缩技术旨在降低通信成本,但能带来最大加速或最小数据交换的理想压缩因子仍是一个开放性问题,因为它随压缩质量、模型大小与结构、硬件、网络拓扑和带宽而变化。我们提出GraVAC,一种通过在训练过程中评估模型进展并评估与压缩相关的梯度信息损失来动态调整压缩因子的框架。GraVAC以在线、黑盒方式工作,无需对模型或其超参数做任何先验假设,同时在相同迭代/轮数下取得与稠密SGD(即无压缩)相同或更好的精度。与使用静态压缩因子相比,GraVAC将ResNet101、VGG16和LSTM的端到端训练时间分别减少了4.32倍、1.95倍和6.67倍。与其他自适应方案相比,我们的框架提供了1.94倍至5.63倍的总体加速。
引用
@article{arxiv.2305.12201,
title = {GraVAC: Adaptive Compression for Communication-Efficient Distributed DL Training},
author = {Sahil Tyagi and Martin Swany},
journal= {arXiv preprint arXiv:2305.12201},
year = {2024}
}