中文

基于自适应结构层次的 3D 生成式世界模型

计算机视觉与模式识别 2026-03-24 v1

摘要

单图像 3D 生成是视觉到图形模型中的核心问题。然而,在稀疏监督下实现对多样化语义类别和高度可变结构复杂度的可靠泛化,仍是根本性挑战。现有方法通常以单一实体建模对象,或依赖固定数量的部件,包括近期的部件感知模型如 PartCrafter,仍需大量人工指定部件数量。此类设计易导致过拟合、结构组件缺失或碎片化,以及在面对新物体布局时受限于组合泛化。为此,本文重新思考单图像 3D 生成,作为在灵活 3D 隐空间中学习自适应部件-整体层次结构。我们提出一种新颖的部件到整体 3D 生成式世界模型,通过从图像标记中推断软性且可组合的掩码,自动发现潜在结构槽位。具体而言,一种自适应槽位门控机制动态确定槽位激活概率,并平滑整合不同物体中冗余的槽位,确保新出现的结构在不同类别间保持紧凑且具表达力。每个提炼后的槽位随后对齐到可学习的、类别无关的特征库中,从而实现跨类别形状共享与去噪。进一步引入轻量级 3D 去噪器,通过统一扩散目标重构几何与外观。实验表明,我们的方法在跨类别迁移和部件计数外推方面 consistently 提升,并通过消融实验确认特征库在形状先验共享以及槽位门控在结构适应方面的互补优势。

关键词

引用

@article{arxiv.2603.21557,
  title  = {From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy},
  author = {Bi'an Du and Daizong Liu and Pufan Li and Wei Hu},
  journal= {arXiv preprint arXiv:2603.21557},
  year   = {2026}
}

备注

Accepted to ICME 2026