中文

SceneTransporter:基于最优传输引导的单图像结构化 3D 场景生成

计算机视觉与模式识别 2026-02-27 v1

摘要

我们引入 SceneTransporter,一个用于从单张图像生成结构化 3D 场景的端到端框架。虽然已有方法生成部件级别的 3D 对象,但往往难以在开放场景中将这些部件组织成独立的实例。通过去偏 clustering probe,我们发现这一失败源于模型内部分配机制缺乏结构约束。基于这一发现,我们将结构化 3D 场景生成任务重新表述为全局相关性分配问题。为解决此问题,SceneTransporter 在组合性 DiT 模型的去噪循环中构建并求解一个熵最优传输(OT)目标。这种表述施加了两个强大的结构约束。首先, resulting transport plan gates cross-attention to enforce an exclusive, one-to-one routing of image patches to part-level 3D latents, preventing entanglement. 其次,transport 的竞争性质鼓励对相似 patch 的分组,这一过程通过基于边的成本进一步正则化,以形成连贯的对象并防止碎片化。大量实验表明,SceneTransporter 在开放场景生成方面优于现有方法,显著改进了实例级一致性和几何保真度。代码和模型将在 https://2019epwl.github.io/SceneTransporter/ 公开。

关键词

引用

@article{arxiv.2602.22785,
  title  = {SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation},
  author = {Ling Wang and Hao-Xiang Guo and Xinzhou Wang and Fuchun Sun and Kai Sun and Pengkun Liu and Hang Xiao and Zhong Wang and Guangyuan Fu and Eric Li and Yang Liu and Yikai Wang},
  journal= {arXiv preprint arXiv:2602.22785},
  year   = {2026}
}

备注

published at iclr 2026