LayoutDiffusion:面向布局到图像生成的可控扩散模型
计算机视觉与模式识别
2024-03-13 v2
摘要
近来,扩散模型在图像合成方面取得了巨大成功。然而,在布局到图像生成任务中,图像通常具有包含多个对象的复杂场景,如何对全局布局图与每个细节对象都实现强控制仍是一项挑战。本文提出一种名为 LayoutDiffusion 的扩散模型,其生成质量与可控性均优于以往工作。为克服图像与布局之间困难的多模态融合,我们提出构建带有区域信息的结构化图像块,并将分块图像转换为特殊布局,以统一形式与常规布局融合。此外,我们提出了布局融合模块(LFM)与对象感知交叉注意力(OaCA)来建模多个对象间的关系,并将其设计为对象感知且位置敏感,从而精确控制空间相关信息。大量实验表明,我们的 LayoutDiffusion 在 COCO-stuff 上的 FID、CAS 指标相对先前 SOTA 方法分别提升 46.35%、26.70%,在 VG 上分别提升 44.29%、41.82%。代码见 https://github.com/ZGCTroy/LayoutDiffusion。
引用
@article{arxiv.2303.17189,
title = {LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation},
author = {Guangcong Zheng and Xianpan Zhou and Xuewei Li and Zhongang Qi and Ying Shan and Xi Li},
journal= {arXiv preprint arXiv:2303.17189},
year = {2024}
}
备注
Accepted by CVPR2023