ParaGAN:生成对抗网络的可扩展分布式训练框架
分布式、并行与集群计算
2024-11-07 v1 人工智能
摘要
生成人工智能的最新进展推动了许多应用,特别是那些涉及生成对抗网络(GAN)的应用,GAN对于合成逼真的照片和视频至关重要。然而,高效训练GAN仍然是一个关键挑战,由于其计算密集型和数值不稳定的特性。现有方法通常需要数天甚至数周的时间进行训练,带来了显著的资源和时间限制。在这项工作中,我们引入了ParaGAN,一个可扩展的分布式GAN训练框架,利用异步训练和非对称优化策略来加速GAN训练。ParaGAN采用拥塞感知的数据管道和硬件感知的布局变换来提高加速器利用率,从而实现了超过30%的吞吐量提升。通过ParaGAN,我们将BigGAN的训练时间从15天缩短到14小时,同时实现了91%的扩展效率。此外,ParaGAN使使用BigGAN进行前所未有的高分辨率图像生成成为可能。
引用
@article{arxiv.2411.03999,
title = {ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks},
author = {Ziji Shi and Jialin Li and Yang You},
journal= {arXiv preprint arXiv:2411.03999},
year = {2024}
}
备注
Accepted at ACM Symposium on Cloud Computing (SoCC) 2024