S^2VG:基于去噪帧矩阵的3D立体和空间视频生成
计算机视觉与模式识别
2025-08-12 v1
摘要
虽然视频生成模型在生成高质量单目视频方面表现出色,但对于生成用于沉浸式应用的3D立体和空间视频仍是一个较少探索的挑战。我们提出了一种无姿态、无需训练的方法,利用现成的单目视频生成模型生成沉浸式3D视频。该方法首先利用估计的深度信息将生成的单目视频变形到预定义的相机视点,然后应用一种新颖的"帧矩阵"inpainting框架。该框架利用原始视频生成模型在不同视点和时间戳之间合成缺失内容,以确保空间和时间一致性,而无需额外的模型微调。此外,我们开发了一种dualupdate方案,通过缓解潜在空间中从遮挡区域传播的负面影响,进一步提高视频inpainting的质量。最终生成的多视角视频可适应为立体对或优化为4D高斯,用于空间视频合成。我们通过在来自各种生成模型的视频(如Sora、Lumiere、WALT和Zeroscope)上进行实验来验证我们方法的有效性。实验结果表明,我们的方法在质量上显著优于先前方法。项目页面:https://daipengwa.github.io/S-2VG_ProjectPage/
引用
@article{arxiv.2508.08048,
title = {S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix},
author = {Peng Dai and Feitong Tan and Qiangeng Xu and Yihua Huang and David Futschik and Ruofei Du and Sean Fanello and Yinda Zhang and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2508.08048},
year = {2025}
}
备注
immsersive video generation