扩散模型如画家般生成图像:先轮廓后细节的分析理论
计算机视觉与模式识别
2024-03-27 v2 人工智能
图形学
神经与进化计算
摘要
扩散生成模型如何将纯噪声转化为有意义的图像?在多种预训练扩散模型(包括Stable Diffusion等条件潜在空间模型)中,我们观察到作为图像生成基础的逆向扩散过程具有以下性质:(i)单个轨迹倾向于低维且类似于二维“旋转”;(ii)布局等高方差场景特征倾向于更早出现,而低方差细节倾向于更晚出现;(iii)早期扰动对图像内容的影响往往大于后期扰动。为理解这些现象,我们推导并研究了高斯分布的概率流ODE的闭式解,其表明逆向扩散状态在图像流形上逐渐旋转朝向一个逐步指定的目标。它还表明生成过程涉及先确定轮廓,再逐步确定越来越精细的细节。我们发现该解准确描述了预训练模型图像生成的初始阶段,并且原则上可通过跳过逆向扩散步骤来提高图像生成效率。最后,我们利用该解刻画了Stable Diffusion中的图像流形。我们的视角揭示了GAN与扩散生成之间意外的相似性,并提供了扩散与图像检索之间的概念联系。
引用
@article{arxiv.2303.02490,
title = {Diffusion Models Generate Images Like Painters: an Analytical Theory of Outline First, Details Later},
author = {Binxu Wang and John J. Vastola},
journal= {arXiv preprint arXiv:2303.02490},
year = {2024}
}
备注
44 pages, 28 figures. A briefer version was presented at NeurIPS23 Workshop on Diffusion Models [arXiv:2311.10892]