DC-Gen:基于深度压缩潜在空间的训练后扩散加速
计算机视觉与模式识别
2025-10-02 v2 人工智能
摘要
现有的文本到图像扩散模型擅长生成高质量图像,但在扩展到高分辨率(如4K图像生成)时面临显著的效率挑战。尽管以往的研究从多个方面加速了扩散模型,但很少处理潜在空间内的固有冗余。为了弥合这一差距,本文引入了DC-Gen,一个通过利用深度压缩的潜在空间来加速文本到图像扩散模型的通用框架。DC-Gen没有采用代价高昂的从零开始训练的方法,而是使用高效的训练后流水线来保持基础模型的质量。该范式中的一个关键挑战是基础模型的潜在空间与深度压缩潜在空间之间的表示差距,这可能导致直接微调时的不稳定性。为了克服这一问题,DC-Gen首先通过轻量级的嵌入对齐训练来弥合表示差距。一旦潜在嵌入对齐,只需少量的LoRA微调即可解锁基础模型固有的生成质量。我们在SANA和FLUX.1-Krea上验证了DC-Gen的有效性。生成的DC-Gen-SANA和DC-Gen-FLUX模型实现了与基础模型相当的质量,但获得了显著的加速。具体而言,DC-Gen-FLUX在NVIDIA H100 GPU上将4K图像生成的延迟降低了53倍。当与NVFP4 SVDQuant结合时,DC-Gen-FLUX在单张NVIDIA 5090 GPU上仅需3.5秒即可生成4K图像,与基础FLUX.1-Krea模型相比实现了138倍的总延迟降低。代码:https://github.com/dc-ai-projects/DC-Gen。
引用
@article{arxiv.2509.25180,
title = {DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space},
author = {Wenkun He and Yuchao Gu and Junyu Chen and Dongyun Zou and Yujun Lin and Zhekai Zhang and Haocheng Xi and Muyang Li and Ligeng Zhu and Jincheng Yu and Junsong Chen and Enze Xie and Song Han and Han Cai},
journal= {arXiv preprint arXiv:2509.25180},
year = {2025}
}
备注
Tech Report. The first three authors contributed equally to this work