SceneNAT:面向语言引导的室内场景合成的掩码生成模型
计算机视觉与模式识别
2026-01-13 v1
摘要
我们提出SceneNAT,一种单阶段掩码非自回归Transformer,通过仅需少量并行解码即可从自然语言指令合成完整的3D室内场景,性能和效率均优于先前的方法。SceneNAT通过对语义和空间属性的完全离散表示进行掩码建模进行训练。通过在属性层面和实例层面同时应用掩码策略,模型能够更好地捕获物体内部分析和物体间结构。为提升关系推理能力,SceneNAT采用专门的三元组预测器,通过将一组可学习的关系查询映射到稀疏的符号三元组(主语、谓词、宾语)来建模场景的布局和物体关系。广泛的在3D-FRONT数据集上的实验表明,SceneNAT在语义合规性和空间布局准确性方面均优于基于自回归和扩散的基线方法,同时计算成本显著降低。
引用
@article{arxiv.2601.07218,
title = {SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis},
author = {Jeongjun Choi and Yeonsoo Park and H. Jin Kim},
journal= {arXiv preprint arXiv:2601.07218},
year = {2026}
}
备注
Under review. Code will be released