中文

SceneTok:用于 3D 场景的压缩、可扩散令牌空间

计算机视觉与模式识别 2026-03-02 v2 人工智能 机器学习

摘要

我们提出了 SceneTok,一种 novel 的用于将场景视图集合编码为压缩且可扩散的非结构化令牌集合的 tokenizer。现有的 3D 场景表示和生成方法常用 3D 数据结构或视图对齐字段。相比之下,我们首次提出将场景信息编码为一小组不变于排列的令牌,且与空间网格解耦。场景令牌由多视图 tokenizer 在给定大量上下文视图后预测,并通过轻量级的rectified flow解码器渲染为新视图。我们表明,与其他表示方法相比,压缩比强烈 1-3 数量级,且仍能达到 state-of-the-art 的重建质量。进一步地,我们的表示可以从新轨迹渲染,包括偏离输入轨迹的轨迹,我们展示了解码器对不确定性的优雅处理能力。最后,高度压缩的非结构化潜在场景令牌使得简单的高效场景生成在 5 秒内完成,实现了显著优于以往范式的质量-速度权衡。

关键词

引用

@article{arxiv.2602.18882,
  title  = {SceneTok: A Compressed, Diffusable Token Space for 3D Scenes},
  author = {Mohammad Asim and Christopher Wewer and Jan Eric Lenssen},
  journal= {arXiv preprint arXiv:2602.18882},
  year   = {2026}
}

备注

Project website: https://geometric-rl.mpi-inf.mpg.de/scenetok/ Minor Revisions