中文

绝对尺度场景生成:利用文本的语义与几何引导实现精确且可解释的3D室内场景生成

计算机视觉与模式识别 2026-03-17 v1

摘要

我们提出了GuidedSceneGen,一个文本到3D生成框架,能够生成度量精确、全局一致且语义可解释的室内场景。与常遭受几何漂移或尺度模糊的先前文本驱动方法不同,我们的方法在整个生成过程中保持绝对世界坐标系。从文本场景描述出发,我们预测一个编码语义和几何结构的全局3D布局,作为下游阶段的引导代理。一个语义和深度条件的全景扩散模型随后合成与全局布局对齐的360°图像,大幅提高了空间一致性。为了探索未观测区域,我们采用由优化相机轨迹引导的视频扩散模型,在覆盖与碰撞避免之间取得平衡,相比穷举路径探索实现了高达10倍的采样加速。生成的视图使用3D高斯溅射进行融合,产生一个一致且完全可导航的绝对尺度3D场景。GuidedSceneGen实现了从布局到重建的物体姿态和语义标签的准确传递,并支持无需重新对齐的渐进式场景扩展。定量结果和用户研究表明,与近期全景文本到3D基线相比,具有更大的3D一致性和布局合理性。

关键词

引用

@article{arxiv.2603.13910,
  title  = {Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation},
  author = {Stefan Ainetter and Thomas Deixelberger and Edoardo A. Dominici and Philipp Drescher and Konstantinos Vardis and Markus Steinberger},
  journal= {arXiv preprint arXiv:2603.13910},
  year   = {2026}
}