LayoutDiffuse:适配基础扩散模型用于布局到图像生成
计算机视觉与模式识别
2023-02-20 v1
摘要
布局到图像生成指的是基于语义布局合成照片级真实感图像的任务。本文中,我们提出 LayoutDiffuse,其将大规模图像或文本-图像数据集上预训练的基础扩散模型适配于布局到图像生成。通过采用基于布局注意力与任务感知提示的新型神经适配器,我们的方法训练高效,生成兼具高感知质量与布局对齐的图像,且需要更少数据。在三个数据集上的实验表明,我们的方法显著优于其他 10 个基于 GAN、VQ-VAE 与扩散模型的生成模型。
引用
@article{arxiv.2302.08908,
title = {LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation},
author = {Jiaxin Cheng and Xiao Liang and Xingjian Shi and Tong He and Tianjun Xiao and Mu Li},
journal= {arXiv preprint arXiv:2302.08908},
year = {2023}
}