仅一次采样:通过自合作扩散 GAN 驾驭单步文本到图像合成
计算机视觉与模式识别
2025-02-26 v6
摘要
近期一些研究尝试将扩散模型与生成式对抗网络 (GAN) 结合,以缓解扩散模型 (DMs) 中迭代去噪推理的计算成本问题。然而,这一路线的现有工作要么 suffer from 训练不稳定和模式坍缩,要么学习效率不佳。为此,本文引入 YOSO,一种新型生成模型,旨在实现高训练稳定性、良好模式覆盖和高保真度的快速可扩展单步图像合成。具体做法是通过自身去噪生成器平滑对抗散度,实现自合作学习。我们展示该方法可作为从头训练单步生成模型,性能具竞争力。此外,我们通过多项有效训练技术(如 latent perceptual loss、latent 判别器用于高效训练以及 IPI (informative prior initialization) 和快速适应阶段用于修正噪声调度器)将 YOSO 扩展至单步文本到图像生成。实验结果表明,YOSO 在单步生成性能上达到最前沿水平,即使采用 Low-Rank Adaptation (LoRA) 微调。特别地,YOSO-PixArt- 可在 512 分辨率下单步生成图像,并能适配至 1024 分辨率无需额外显式训练,仅需约 10 个 A800 天的微调。我们的代码已公开于 https://github.com/Luo-Yihong/YOSO。
关键词
引用
@article{arxiv.2403.12931,
title = {You Only Sample Once: Taming One-Step Text-to-Image Synthesis by Self-Cooperative Diffusion GANs},
author = {Yihong Luo and Xiaolong Chen and Xinghua Qu and Tianyang Hu and Jing Tang},
journal= {arXiv preprint arXiv:2403.12931},
year = {2025}
}
备注
ICLR 2025