中文

I-Scene:3D 实例模型是隐式可泛化的空间学习器

计算机视觉与模式识别 2026-01-08 v2

摘要

泛化仍是交互式 3D 场景生成的核心挑战。现有基于学习的方法将空间理解锚定在有限的场景数据集上,限制了对新布局的泛化能力。我们转而重新编程一个预训练的 3D 实例生成器,使其充当场景级学习器,用基于模型的空间监督替代数据集受限的监督。这种重新编程释放了生成器的可迁移空间知识,使其能够泛化到未见布局和新型物体组合。值得注意的是,即使训练场景由随机组合的物体构成,空间推理仍然涌现。这表明生成器的可迁移场景先验提供了从纯几何线索推断邻近性、支撑性和对称性的丰富学习信号。我们以视角中心化的场景空间表述替代广泛使用的规范空间,得到了一个完全前馈、可泛化的场景生成器,可直接从实例模型中学习空间关系。定量和定性结果表明,3D 实例生成器是一个隐式的空间学习与推理器,指向交互式 3D 场景理解与生成的基础模型。项目页面:https://luling06.github.io/I-Scene-project/

关键词

引用

@article{arxiv.2512.13683,
  title  = {I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners},
  author = {Lu Ling and Yunhao Ge and Yichen Sheng and Aniket Bera},
  journal= {arXiv preprint arXiv:2512.13683},
  year   = {2026}
}