中文

TiP4GEN:文本到沉浸式全景4D场景生成

计算机视觉与模式识别 2025-08-22 v2

摘要

随着VR/AR技术的快速发展和广泛采用,日益增长的需求是创建高质量、沉浸式的动态场景。然而,现有的生成作品主要集中在静态场景或狭窄的视角视图的动态场景上,无法提供从任何视角观察的真正360度沉浸式体验。本文提出一种名为TiP4GEN的高级文本到动态全景场景生成框架,能够实现细粒度内容控制并合成富有运动的、几何一致的全景4D场景。TiP4GEN集成了全景视频生成和动态场景重建,以创建360度沉浸式虚拟环境。对于视频生成,我们引入一种双分支生成模型,由全景分支和视角分支组成,分别负责全局和局部视图的生成。双向交叉注意力机制促进了分支之间的全面信息交换。对于场景重建,我们提出一种基于3D高斯溅写(3D Gaussian Splatting)的几何对齐重建模型。通过使用度量深度图对时空点云进行对齐,并初始化估计相机位姿,我们的方法确保了重建场景的几何一致性和时间一致性。大量实验表明,我们的设计有效且TiP4GEN在生成视觉上引人注目且运动连贯的动态全景场景方面具有优势。我们的项目页面位于https://ke-xing.github.io/TiP4GEN/。

关键词

引用

@article{arxiv.2508.12415,
  title  = {TiP4GEN: Text to Immersive Panorama 4D Scene Generation},
  author = {Ke Xing and Hanwen Liang and Dejia Xu and Yuyang Yin and Konstantinos N. Plataniotis and Yao Zhao and Yunchao Wei},
  journal= {arXiv preprint arXiv:2508.12415},
  year   = {2025}
}

备注

Accepted In Proceedings of the 33rd ACM International Conference on Multimedia (MM' 25)