中文

SwiftDiffusion:带有附加模块的高效扩散模型服务

分布式、并行与集群计算 2024-12-09 v2 人工智能 机器学习

摘要

使用扩散模型进行文本到图像(T2I)生成已成为当今AI云中的一项重磅服务。生产级T2I服务通常涉及一个服务工作流,其中基础扩散模型被各种“附加”模块(特别是ControlNet和LoRA)增强,以增强图像生成控制。与单独服务基础模型相比,这些附加模块引入了显著的加载和计算开销,导致延迟增加。在本文中,我们提出了SwiftDiffusion,一个通过整体方法高效服务T2I工作流的系统。SwiftDiffusion将ControlNet与基础模型解耦,并将其作为独立的、可扩展的服务部署在专用GPU上,从而实现ControlNet的缓存、并行化和共享。为了缓解LoRA服务的高加载开销,SwiftDiffusion采用了一种有界异步LoRA加载(BAL)技术,允许LoRA加载与初始基础模型执行重叠多达k步,而不会影响图像质量。此外,SwiftDiffusion通过一种新颖的潜在并行性技术优化了基础模型的执行。综合来看,这些设计使SwiftDiffusion能够超越最先进的T2I服务系统,在H800 GPU上服务SDXL模型时,实现高达7.8倍的延迟降低和1.6倍的吞吐量提升,且不牺牲图像质量。

关键词

引用

@article{arxiv.2407.02031,
  title  = {SwiftDiffusion: Efficient Diffusion Model Serving with Add-on Modules},
  author = {Suyi Li and Lingyun Yang and Xiaoxiao Jiang and Hanfeng Lu and Dakai An and Zhipeng Di and Weiyi Lu and Jiawei Chen and Kan Liu and Yinghao Yu and Tao Lan and Guodong Yang and Lin Qu and Liping Zhang and Wei Wang},
  journal= {arXiv preprint arXiv:2407.02031},
  year   = {2024}
}