中文

理解文本到图像扩散模型的工作机制

计算机视觉与模式识别 2024-10-29 v3 机器学习

摘要

最近,强大的潜在扩散概率模型(DPM)已被应用于高质量的文本到图像(T2I)生成(例如,Stable Diffusion),通过将编码的目标文本提示注入逐步去噪的扩散图像生成器中。尽管DPM在实践中取得了成功,但其背后的机制仍有待探索。为了填补这一空白,我们首先检查了DPM逐步去噪生成过程中的中间状态。经验观察表明,图像形状在前几个去噪步骤后重建,然后图像被填充细节(例如,纹理)。这种现象是因为在DPM添加噪声的前向过程(生成的初始阶段)中,噪声图像的低频信号(与形状相关)直到最后阶段才被破坏。受这些观察的启发,我们继续探索文本提示中每个token在这两个阶段的影响。在一系列基于一组文本提示的T2I生成实验之后,我们得出结论:在较早的生成阶段,图像主要由文本提示中的特殊token [\texttt{EOS}] 决定,并且文本提示中的信息在此阶段已经传达。之后,扩散模型通过自身的信息完成生成图像的细节。最后,我们提出应用这一观察结果,通过适当移除文本引导来加速T2I生成过程,最终将采样速度提升25%以上。

关键词

引用

@article{arxiv.2405.15330,
  title  = {Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model},
  author = {Mingyang Yi and Aoxue Li and Yi Xin and Zhenguo Li},
  journal= {arXiv preprint arXiv:2405.15330},
  year   = {2024}
}