StereoCrafter:基于扩散的从单目视频生成长篇高保真立体3D
计算机视觉与模式识别
2024-09-12 v1 图形学
摘要
本文提出了一种将2D视频转换为沉浸式立体3D的新框架,以满足沉浸式体验中对3D内容日益增长的需求。利用基础模型作为先验,我们的方法克服了传统方法的局限性,并提升了性能,以确保显示设备所需的高保真生成。所提出的系统包括两个主要步骤:基于深度的视频splatting用于扭曲和提取遮挡掩码,以及立体视频修复。我们利用预训练的稳定视频扩散作为骨干,并为立体视频修复任务引入了一种微调协议。为了处理不同长度和分辨率的输入视频,我们探索了自回归策略和分块处理。最后,开发了一个复杂的数据处理流程,以重建一个大规模高质量的数据集来支持我们的训练。我们的框架在2D到3D视频转换方面展示了显著的改进,为创建适用于Apple Vision Pro和3D显示器等3D设备的沉浸式内容提供了一种实用解决方案。总之,这项工作通过提出一种从单目输入生成高质量立体视频的有效方法,为该领域做出了贡献,可能改变我们体验数字媒体的方式。
引用
@article{arxiv.2409.07447,
title = {StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos},
author = {Sijie Zhao and Wenbo Hu and Xiaodong Cun and Yong Zhang and Xiaoyu Li and Zhe Kong and Xiangjun Gao and Muyao Niu and Ying Shan},
journal= {arXiv preprint arXiv:2409.07447},
year = {2024}
}
备注
11 pages, 10 figures