SPATIALGEN: 布局引导的 3D 室内场景生成
计算机视觉与模式识别
2026-01-16 v4
摘要
创建高保真度的 3D 室内环境模型对于设计、虚拟现实和机器人应用至关重要。然而,手动 3D 建模仍然耗时且劳动密集。尽管生成式 AI 的最新进展已实现自动化场景合成,现有方法往往在视觉质量、多样性、语义一致性和用户控制之间难以平衡。一个主要瓶颈是缺乏针对此任务的大规模高质量数据集。为填补这一空白,我们引入了一个全面的合成数据集,包含 12,328 个结构化标注场景、57,431 个房间和 470 万张照片级真实感的 2D 渲染图。利用该数据集,我们提出了 SpatialGen,一种新颖的多视角多模态扩散模型,用于生成真实且语义一致的 3D 室内场景。给定一个 3D 布局和一张参考图像(源自文本提示),我们的模型从任意视角合成外观(彩色图像)、几何(场景坐标图)和语义(语义分割图),同时保持模态间的空间一致性。SpatialGen 在我们的实验中始终生成优于先前方法的结果。我们开源了数据和模型,以赋能社区并推动室内场景理解与生成领域的发展。
引用
@article{arxiv.2509.14981,
title = {SPATIALGEN: Layout-guided 3D Indoor Scene Generation},
author = {Chuan Fang and Heng Li and Yixun Liang and Jia Zheng and Yongsen Mao and Yuan Liu and Rui Tang and Zihan Zhou and Ping Tan},
journal= {arXiv preprint arXiv:2509.14981},
year = {2026}
}
备注
3D scene generation; diffusion model; Scene reconstruction and understanding