具有重叠感知梯度压缩的近线性扩展数据并行训练
分布式、并行与集群计算
2023-11-09 v1
摘要
现有的深度神经网络(DNNs)数据并行(DP)训练常因巨大的通信开销而面临加速可扩展性受限的问题。尽管重叠技术可通过并行化 DP 中的通信与计算来缓解该问题,但其效果受限于 DP 训练任务较高的通信计算比(CCR)。梯度压缩(GC)是一种通过直接减少通信量来获得更低 CCR 的有前景的技术。然而,将 GC 应用于重叠中以获得真实性能提升具有挑战性,原因在于(1)传统 GC 中由高压缩开销引起的严重性能损失,以及(2)GC 方案中可能存在的数据依赖导致重叠收益下降。本文提出 COVAP,一种设计新型粗粒度过滤器的 GC 方案,使压缩开销接近于零。COVAP 通过采用针对特定训练任务的自适应压缩比和张量分片,确保通信与计算几乎完全重叠。COVAP 还采用改进的错误反馈机制以维持训练精度。实验在搭载不同真实应用 DNNs 的阿里云 ECS 实例上进行。结果表明 COVAP 在求解时间上优于现有 GC 方案 1.92x–15.39x,并展现出近线性扩展。此外,COVAP 在四种不同集群规模的实验中均取得最佳可扩展性。
引用
@article{arxiv.2311.04499,
title = {Near-Linear Scaling Data Parallel Training with Overlapping-Aware Gradient Compression},
author = {Lin Meng and Yuzhong Sun and Weimin Li},
journal= {arXiv preprint arXiv:2311.04499},
year = {2023}
}
备注
10 pages, 11 figures