中文

LayoutDiffuse:适配基础扩散模型用于布局到图像生成

计算机视觉与模式识别 2023-02-20 v1

摘要

布局到图像生成指的是基于语义布局合成照片级真实感图像的任务。本文中,我们提出 LayoutDiffuse,其将大规模图像或文本-图像数据集上预训练的基础扩散模型适配于布局到图像生成。通过采用基于布局注意力与任务感知提示的新型神经适配器,我们的方法训练高效,生成兼具高感知质量与布局对齐的图像,且需要更少数据。在三个数据集上的实验表明,我们的方法显著优于其他 10 个基于 GAN、VQ-VAE 与扩散模型的生成模型。

关键词

引用

@article{arxiv.2302.08908,
  title  = {LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation},
  author = {Jiaxin Cheng and Xiao Liang and Xingjian Shi and Tong He and Tianjun Xiao and Mu Li},
  journal= {arXiv preprint arXiv:2302.08908},
  year   = {2023}
}