中文

Any 3D Scene is Worth 1K Tokens: 3D场景生成的高效表征

计算机视觉与模式识别 2026-04-14 v1 计算几何

摘要

3D场景生成长期以来主要依赖2D多视角或视频扩散模型。这不仅是由于缺乏场景级3D潜在表征,还因为大多数场景级3D视觉数据以多视角图像或视频形式存在,这些数据天然适合2D扩散架构。通常,这些基于2D的方法将3D空间外推降级为2D时间扩展,引入两个根本性问题:(i)通过2D视图表示3D场景会导致显著的表示冗余,(ii)基于2D的潜在空间本质上限制了生成3D场景的空间一致性。本文首次提出在隐式3D潜在空间中直接进行3D场景生成,以解决这些限制。首先,我们将冻结的2D表示编码器重新用于构建我们的3D表示自编码器(3DRAE),将视图耦合的2D语义表示锚定到视图解耦的3D潜在表示中。这使得能够以任意视角数目、分辨率和宽高比比例表示3D场景,保持固定复杂度和丰富语义。随后我们引入3D扩散Transformer(3DDiT),在该3D潜在空间中进行扩散建模,实现了极其高效且在空间上一致的3D场景生成,同时支持多样化的条件配置。此外,由于我们的做法直接生成3D场景表征,可以解码为任意相机轨迹上的图像和可选点图,无需常见于2D方法的每个轨迹扩散采样路径。

关键词

引用

@article{arxiv.2604.11331,
  title  = {Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale},
  author = {Dongxu Wei and Qi Xu and Zhiqi Li and Hangning Zhou and Cong Qiu and Hailong Qin and Mu Yang and Zhaopeng Cui and Peidong Liu},
  journal= {arXiv preprint arXiv:2604.11331},
  year   = {2026}
}

备注

Under Review. Project Page: https://wswdx.github.io/3DRAE