中文

Build-A-Scene:面向扩散图像生成的交互式三维布局控制

计算机视觉与模式识别 2024-08-28 v1

摘要

我们提出了一种基于扩散的方法,用于具有交互式三维布局控制的文本到图像(T2I)生成。布局控制已被广泛研究,以缓解T2I扩散模型在理解文本描述中物体的位置和关系方面的不足。然而,现有的布局控制方法仅限于二维布局,要求用户预先提供静态布局,并且在布局变化时无法保留已生成的图像。这使得这些方法不适用于需要三维物体级控制和迭代优化的应用,例如室内设计和复杂场景生成。为此,我们利用深度条件T2I模型的最新进展,提出了一种新颖的交互式三维布局控制方法。我们用三维框替换了布局控制中使用的传统二维框。此外,我们将T2I任务改造为一个多阶段生成过程,在每个阶段,用户可以在三维空间中插入、更改和移动一个物体,同时保留早期阶段生成的物体。我们通过提出的动态自注意力(DSA)模块和一致的三维物体平移策略来实现这一点。实验表明,我们的方法能够基于三维布局生成复杂的场景,将物体生成成功率相较于标准深度条件T2I方法提升了2倍。此外,在布局变化下保留物体方面,它也优于其他对比方法。项目页面:\url{https://abdo-eldesokey.github.io/build-a-scene/}

关键词

引用

@article{arxiv.2408.14819,
  title  = {Build-A-Scene: Interactive 3D Layout Control for Diffusion-Based Image Generation},
  author = {Abdelrahman Eldesokey and Peter Wonka},
  journal= {arXiv preprint arXiv:2408.14819},
  year   = {2024}
}

备注

Project Page: https://abdo-eldesokey.github.io/build-a-scene/