中文

通过构图、绘画与修饰,利用扩散模型生成复杂场景

计算机视觉与模式识别 2024-08-27 v1 机器学习

摘要

最近的文本到图像扩散模型在图像质量方面展现了惊人的能力,但复杂场景生成仍相对未被充分探索,甚至“复杂场景”本身的定义尚不明确。本文通过提供精确的复杂场景定义,引入一套基于该定义的复杂分解标准(CDC),以填补这一空白。灵感来自艺术家的绘画过程,我们提出一种无训练的扩散框架Complex Diffusion(CxD),将过程分为三个阶段:构图、绘画与修饰。我们利用大型语言模型(LLM)的强大链式思维能力,对复杂提示进行分解并依据CDC管理构图与布局。随后,我们开发注意力调制方法,引导简单提示定位到特定区域以完成复杂场景绘画。最后,我们将LLM的详细输出注入修饰模型,以增强图像细节,从而实现修饰阶段。广泛实验表明,我们的方法优于先前的SOTA方法,显著提升了即使在复杂提示下,高质量、语义一致和视觉多样化图像的生成能力。

关键词

引用

@article{arxiv.2408.13858,
  title  = {Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching},
  author = {Minghao Liu and Le Zhang and Yingjie Tian and Xiaochao Qu and Luoqi Liu and Ting Liu},
  journal= {arXiv preprint arXiv:2408.13858},
  year   = {2024}
}