中文

EchoScene:基于场景图扩散中信息回声的室内场景生成

计算机视觉与模式识别 2025-02-28 v2 人工智能 机器学习

摘要

我们提出了 EchoScene,一种基于场景图生成 3D 室内场景的交互式可控生成模型。EchoScene 利用动态适应场景图的双分支扩散模型。由于节点数量可变、边组合多样以及操作引起的节点-边操作,现有方法难以处理场景图。EchoScene 通过将每个节点与一个去噪过程相关联并实现协同信息交换来克服这一问题,从而增强了具有全局约束感知的可控与一致性生成。这是通过在形状分支和布局分支中采用信息回声方案实现的。在每个去噪步骤中,所有过程将其去噪数据共享给一个信息交换单元,该单元利用图卷积组合这些更新。该方案确保去噪过程受到对场景图整体理解的影响,从而促进全局一致场景的生成。在推理过程中,可以通过编辑输入场景图和对扩散模型中的噪声进行采样来操控生成的场景。大量实验验证了我们的方法,该方法保持了场景可控性,并在生成保真度上超越了以往方法。此外,生成的场景具有高质量,因此可直接与现有的纹理生成兼容。代码和训练模型已开源。

关键词

引用

@article{arxiv.2405.00915,
  title  = {EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion},
  author = {Guangyao Zhai and Evin Pınar Örnek and Dave Zhenyu Chen and Ruotong Liao and Yan Di and Nassir Navab and Federico Tombari and Benjamin Busam},
  journal= {arXiv preprint arXiv:2405.00915},
  year   = {2025}
}

备注

Nectar Track at 3DV 2025