用于三维室内场景合成的混合扩散模型
计算机视觉与模式识别
2024-12-11 v2
摘要
生成逼真的三维场景是计算机视觉和机器人领域日益增长的兴趣点。然而,创建高质量、多样化的合成三维内容通常需要专家干预,这使得其成本高昂且复杂。最近,用学习技术(特别是扩散模型)自动化这一过程的努力在家具重新排列等任务上取得了显著改进。然而,将扩散模型应用于基于房间布局的室内场景合成仍然研究不足。这项任务尤其具有挑战性,因为它需要在连续空间中排列对象,同时从离散的对象类别中进行选择,这对传统的扩散方法构成了独特的困难。为了弥补这一差距,我们提出了MiDiffusion,一种新颖的混合离散-连续扩散模型,旨在在给定房间布局和预排列对象的情况下合成合理的3D室内场景。我们通过2D房间布局和一组对象来表示场景布局,每个对象由类别、位置、大小和方向定义。我们的方法独特地将结构化噪声应用于混合的离散语义域和连续几何域,从而为去噪提供了一个条件更好的问题。在3D-FRONT数据集上的评估表明,MiDiffusion在基于房间布局的3D场景合成中优于最先进的自回归和扩散模型。此外,它通过噪声注入和掩码策略有效地处理部分对象约束,而无需特定任务训练,在场景补全和家具排列任务中展示了优势。
引用
@article{arxiv.2405.21066,
title = {Mixed Diffusion for 3D Indoor Scene Synthesis},
author = {Siyi Hu and Diego Martin Arroyo and Stephanie Debats and Fabian Manhardt and Luca Carlone and Federico Tombari},
journal= {arXiv preprint arXiv:2405.21066},
year = {2024}
}
备注
16 pages, 10 figures. Under review. Code released at: https://github.com/MIT-SPARK/MiDiffusion