中文

通过文本到图像 RGBA 实例生成合成组合场景

计算机视觉与模式识别 2024-11-19 v1 机器学习

摘要

文本到图像扩散生成模型能够生成高质量图像,但代价是繁琐的提示工程。通过引入布局条件可以改善可控性,然而现有方法缺乏布局编辑能力和对对象属性的细粒度控制。多层生成的概念在解决这些局限性方面具有巨大潜力,但将图像实例生成与场景组合同时进行,限制了对细粒度对象属性、三维空间中的相对定位以及场景操控能力的控制。在这项工作中,我们提出了一种新颖的多阶段生成范式,专为细粒度控制、灵活性和交互性而设计。为确保对实例属性的控制,我们设计了一种新颖的训练范式,使扩散模型能够生成带有透明度信息的 RGBA 图像形式的孤立场景组件。为构建复杂图像,我们使用这些预生成的实例,并引入一个多层合成生成过程,将组件平滑地组装到逼真的场景中。我们的实验表明,我们的 RGBA 扩散模型能够生成多样化且高质量的实例,并对对象属性进行精确控制。通过多层合成,我们证明我们的方法能够从高度复杂的提示中构建和操控图像,并对对象外观和位置进行细粒度控制,相比竞争方法提供了更高的控制度。

关键词

引用

@article{arxiv.2411.10913,
  title  = {Generating Compositional Scenes via Text-to-image RGBA Instance Generation},
  author = {Alessandro Fontanella and Petru-Daniel Tudosiu and Yongxin Yang and Shifeng Zhang and Sarah Parisot},
  journal= {arXiv preprint arXiv:2411.10913},
  year   = {2024}
}

备注

NeurIPS 2024