HoloTime:面向全景 4D 场景生成的视频扩散模型
计算机视觉与模式识别
2025-05-14 v2
摘要
扩散模型的快速发展为 VR 和 AR 技术的应用指明了前景,这些技术通常需要场景级的 4D 资产以提供用户体验。然而,现有的扩散模型主要集中于建模静态 3D 场景或对象级动态,从而限制了其提供真实沉浸式体验的能力。为此,我们提出了 HoloTime 框架,将视频扩散模型集成以从单个提示或参考图像生成全景视频,并提出一种 360 度 4D 场景重建方法,将生成的全景视频无缝转化为 4D 资产,为用户实现完全沉浸式的 4D 体验。具体而言,为驾驭全景视频生成模型以生成高保真全景视频,我们引入了 360World 数据集,这是首个适用于下游 4D 场景重建任务的全景视频综合数据集。有了这一数据集,我们提出了 Panoramic Animator,一种两阶段的图像到视频扩散模型,可将全景图像转换为高质量的全景视频。随后,我们提出了 Panoramic Space-Time Reconstruction,该方法利用时空深度估计方法将生成的全景视频转化为 4D 点云,从而优化表示为整体 4D 高斯溅射的 representation,以重建在空间和时间上一致的 4D 场景。为验证我们方法的有效性,我们对比分析了与现有方法,揭示了其在全景视频生成和 4D 场景重建方面的优势。这表明我们的方法能够创建更具吸引力和真实感的沉浸式环境,从而提升 VR 和 AR 应用中的用户体验。
引用
@article{arxiv.2504.21650,
title = {HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation},
author = {Haiyang Zhou and Wangbo Yu and Jiawen Guan and Xinhua Cheng and Yonghong Tian and Li Yuan},
journal= {arXiv preprint arXiv:2504.21650},
year = {2025}
}
备注
Project Homepage: https://zhouhyocean.github.io/holotime/ Code: https://github.com/PKU-YuanGroup/HoloTime