Poplar:异构GPU集群上分布式DNN训练的高效扩展
分布式、并行与集群计算
2024-08-23 v1
摘要
扩缩深度神经网络(DNN)需要大量GPU数量和计算资源。实际情况下,由于GPU产品迭代快速,通常存在大量异构GPU设备。因此,高效且经济地利用异构GPU的计算能力至关重要,以满足DNN研究和开发需求。本文介绍Poplar,这是一个扩展了零冗余优化器(ZeRO)并具备异构感知能力的分布式训练系统。我们探索了更广泛的GPU异构性,包括计算能力、内存容量、数量以及它们的组合。为了在所有异构条件下实现高计算效率,Poplar对每个ZeRO阶段的GPU进行细粒度测量。我们提出了一种新颖的批量分配方法和搜索算法,以优化异构GPU集群的利用率。此外,Poplar实现了完全自动的并行化,消除了需要部署异构硬件和寻找合适批量大小的需求。在三个由六种不同类型GPU组成的异构集群上的大量实验表明,Poplar相对于当前最先进的异构训练系统实现了1.02-3.92倍的训练吞吐量提升。
引用
@article{arxiv.2408.12596,
title = {Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters},
author = {WenZheng Zhang and Yang Hu and Jing Shi and Xiaoying Bai},
journal= {arXiv preprint arXiv:2408.12596},
year = {2024}
}