改进扩散模型以提升提示符合度与可控图像合成
计算机视觉与模式识别
2024-10-30 v1
摘要
扩散过程(Diffusion Processes, DPs)在生成式建模方面的最新进展促成了图像合成的突破。尽管图像质量令人印象深刻,但这些模型存在各种提示符合度问题,包括生成多个对象时的低召回率、难以在图像中生成文本,以及难以满足对象位置和姿态等约束。对于细粒度编辑与操作,它们还需要手动制作繁琐的细粒度语义图或实例图。虽然可以通过在推理时添加损失函数来增强提示符合度,但这非常耗时且无法扩展至复杂场景。为了克服这些局限性,本文引入了一类新的因子图扩散模型(Factor Graph Diffusion Models, FG-DMs),通过因子图分解对图像与条件变量(如语义图、草图、深度图或法线图)的联合分布进行建模。这种联合结构具有多项优势,包括支持基于高效采样的提示符合度方案(可生成高对象召回率的图像)、半自动细粒度编辑、利用噪声反演进行基于文本的条件编辑、中间层级的可解释性、能够生成用于训练下游模型(如分割或深度模型)的带标签数据集、支持缺失数据训练,以及持续学习(可在对现有结构进行极少或无需修改的情况下添加新的条件变量)。我们提出了一种 FG-DMs 的实现,通过适配预训练的 Stable Diffusion (SD) 模型来实现所有 FG-DM 因子,仅使用 COCO 数据集,并证明它在生成图像时召回率比 SD 高 15%,同时保留了其泛化能力。我们引入了注意力蒸馏损失,以鼓励所有因子的注意力图之间保持一致性,从而提高生成条件和图像的保真度。
引用
@article{arxiv.2410.21638,
title = {Adapting Diffusion Models for Improved Prompt Compliance and Controllable Image Synthesis},
author = {Deepak Sridhar and Abhishek Peri and Rohith Rachala and Nuno Vasconcelos},
journal= {arXiv preprint arXiv:2410.21638},
year = {2024}
}
备注
Accepted to NeurIPS 2024 conference. Project Page: https://deepaksridhar.github.io/factorgraphdiffusion.github.io/