中文

Terra: 基于点隐变量的可探索原生3D世界模型

计算机视觉与模式识别 2025-10-17 v1 人工智能 机器学习

摘要

世界模型因对真实世界的全面建模而日益受到关注。然而,现有大多数方法仍依赖像素对齐的表示作为世界演化的基础,忽视了物理世界固有的3D特性。这可能破坏3D一致性并降低世界模型的建模效率。在本文中,我们提出了Terra,一个原生3D世界模型,它在内在的3D隐空间中表示和生成可探索的环境。具体来说,我们提出了一种新颖的点到高斯变分自编码器(P2G-VAE),它将3D输入编码为隐式点表示,随后解码为3D高斯原语以联合建模几何和外观。然后,我们引入了一个稀疏点流匹配网络(SPFlow)用于生成隐式点表示,该网络同时去噪点隐变量的位置和特征。我们的Terra通过原生3D表示和架构实现了精确的多视图一致性,并支持仅通过一次生成过程从任意视角进行灵活渲染。此外,Terra通过在点隐空间中进行渐进式生成实现了可探索的世界建模。我们在ScanNet v2的具有挑战性的室内场景上进行了大量实验。Terra在重建和生成方面均达到了最先进的性能,并具有高度的3D一致性。

关键词

引用

@article{arxiv.2510.14977,
  title  = {Terra: Explorable Native 3D World Model with Point Latents},
  author = {Yuanhui Huang and Weiliang Chen and Wenzhao Zheng and Xin Tao and Pengfei Wan and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2510.14977},
  year   = {2025}
}

备注

Project Page: https://huang-yh.github.io/terra/