中文

M3DLayout:用于3D场景生成的多来源3D室内布局和结构描述数据集

计算机视觉与模式识别 2026-03-19 v3 人工智能

摘要

在文本驱动的3D场景生成中,对象布局作为一种关键的中间表示,桥接了高层语言指令与详细几何输出之间的关系。它不仅为确保物理可行性提供了结构蓝图,还支持语义可控性和交互式编辑。然而,当前3D室内布局生成模型的学习能力受限于现有数据集的规模、多样性和注释质量。为此,我们引入M3DLayout,一个用于3D室内布局生成的大规模、多来源数据集。M3DLayout包含21,367个布局和433k多个对象实例,整合了三个distinct sources:真实世界扫描、专业CAD设计和程序化场景。每个布局都配有详细的结构文本描述,包括全局场景概述、大型家具的关系布局以及小型物品的细粒度安排。这个多样且丰富地注释的资源使模型能够在广泛的室内环境中学习复杂的空间和语义模式。为评估M3DLayout的潜力,我们使用文本条件扩散模型和文本条件自回归模型建立了基准。实验结果表明,我们的数据集为训练布局生成模型提供了坚实的基础。其多来源组成通过Inf3DLayout子数据集显著提升了多样性,后者提供丰富的小物信息,使生成的场景更加复杂和细致。我们希望M3DLayout能够为推动文本驱动的3D场景合成研究提供有价值的资源。所有数据集和代码将在接受后公开。

关键词

引用

@article{arxiv.2509.23728,
  title  = {M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation},
  author = {Yiheng Zhang and Zhuojiang Cai and Mingdao Wang and Meitong Guo and Tianxiao Li and Li Lin and Yuwang Wang},
  journal= {arXiv preprint arXiv:2509.23728},
  year   = {2026}
}

备注

CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/