Eye2Eye:单目到立体视频合成的简单方法
计算机视觉与模式识别
2025-05-02 v1
摘要
沉浸式视觉体验的流行度不断提升,推动了立体 3D 视频生成的热情。尽管视频合成取得了显著进展,但要实现 3D 视频仍具有挑战性,这主要源于 3D 视频数据的稀缺。我们提出一种简单的方法,将文本到视频生成器转化为视频到立体生成器。给定输入视频,本框架自动生成从偏移视点获取的视频帧,从而实现引人注目的 3D 效果。先前或并行的方法通常以多个阶段操作:首先估计视频视差或深度,然后按比例变形以生成第二个视点,最后对遮挡区域进行填充。这种方法在场景包含镜面或透明物体时会失败。在这种情况下,单层视差估计不足,导致变形过程中出现伪影和错误的像素位移。我们的工作通过直接合成新的视点来绕过这些限制,避免了任何中间步骤。这通过利用预训练视频模型对几何、物体材料、光学和语义的先验知识实现,不依赖外部几何模型或手动解耦几何与合成过程。我们在包含多样化物体材料和构成的复杂真实场景中展示了该方法的优势。详见 https://video-eye2eye.github.io 上的视频演示。
引用
@article{arxiv.2505.00135,
title = {Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis},
author = {Michal Geyer and Omer Tov and Linyi Jin and Richard Tucker and Inbar Mosseri and Tali Dekel and Noah Snavely},
journal= {arXiv preprint arXiv:2505.00135},
year = {2025}
}