中文

PrITTI:基于原始元素的可控且可编辑的 3D 语义城市场景生成

计算机视觉与模式识别 2026-05-26 v3

摘要

现有的 3D 语义城市场景生成方法主要依赖基于体素的表示,受限于固定分辨率、编辑困难以及稠密形式下的高内存开销。相反,我们提出基于原始元素(primitive)的范式,利用紧凑且具有语义意义的 3D 元素来表示城市场景,这些元素易于操作和组合。为此,我们引入 PrITTI,一种基于向量化对象原始元素和光栅化地面表面的潜在扩散模型,用于生成多样化、可控且可编辑的 3D 语义城市场景。这种混合表示构建了结构化的潜在空间,促进了对象级和地面级的操控。在 KITTI-360 数据集上的实验表明,基于原始元素的方法能够充分发挥扩散 Transformer 的潜力,实现比基于体素的方法在 3D 场景生成质量、内存需求、推理速度和可编辑性方面的状态突破。除了生成功能外,PrITTI 还支持场景编辑、图像填充、图像扩写以及照片级街景合成等多种下游应用。源码和更多结果可在 https://raniatze.github.io/pritti/ 查看。

关键词

引用

@article{arxiv.2506.19117,
  title  = {PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes},
  author = {Christina Ourania Tze and Daniel Dauner and Yiyi Liao and Dzmitry Tsishkou and Andreas Geiger},
  journal= {arXiv preprint arXiv:2506.19117},
  year   = {2026}
}

备注

Accepted to CVPR 2026