中文

SpeedUpNet:用于加速文本到图像扩散模型的即插即用适配器网络

计算机视觉与模式识别 2024-10-02 v4 机器学习

摘要

文本到图像扩散模型(SD)展现出显著进步,但需要大量计算资源。现有的加速方法通常需要大量训练且不具备普适性。LCM-LoRA 虽可通过一次训练适用于多种模型而具备普适性,却极少考虑确保加速前后生成内容的一致性。本文提出 SpeedUpNet(SUN),一种创新的加速模块,以解决普适性与一致性的挑战。利用 U-Net 中交叉注意力层在 SD 模型中的作用,我们引入了专为这些层设计的适配器,量化了负向提示相对于正向提示在图像生成中引起的偏移。这种学习到的偏移在一系列模型中表现出稳定性,增强了 SUN 的普适性。为提高输出一致性,我们提出了多步一致性损失,用于稳定偏移并确保加速内容的保真度。在 SD v1.5 上的实验表明,与基线 25 步 DPM-solver++ 相比,SUN 实现了超过 10 倍的整体加速,并提供两个额外优势:(1)免训练集成到各种微调的 Stable-Diffusion 模型中;(2)在由正负向提示随机组合引导的加速前后,生成数据集具有 SOTA 的 FID。代码可用:https://williechai.github.io/speedup-plugin-for-stable-diffusions.github.io。

关键词

引用

@article{arxiv.2312.08887,
  title  = {SpeedUpNet: A Plug-and-Play Adapter Network for Accelerating Text-to-Image Diffusion Models},
  author = {Weilong Chai and DanDan Zheng and Jiajiong Cao and Zhiquan Chen and Changbao Wang and Chenguang Ma},
  journal= {arXiv preprint arXiv:2312.08887},
  year   = {2024}
}

备注

Accepted to ECCV 2024