SpatialDreamer: 从单目输入自监督合成双目立体视频
计算机视觉与模式识别
2025-04-29 v2 人工智能
摘要
从单目输入合成双目立体视频是空间计算和虚拟现实领域的一项高难度任务。该任务的主要挑战在于缺乏用于训练的高质量成对双目立体视频,以及难以保持帧间的时空一致性。现有方法主要通过将新视角合成(NVS)技术直接应用于视频来解决这些问题,但面临无法有效表示动态场景以及需要大量训练数据等局限性。本文引入了一种基于视频扩散模型的新型自监督双目立体视频合成范式,称为 SpatialDreamer,直接应对这些挑战。首先,为解决双目立体视频数据不足的问题,我们提出了基于深度的视频生成模块 DVG,该模块采用前后向渲染机制来生成具有几何与时间先验的成对视频。利用 DVG 生成的数据,我们提出了 RefinerNet 以及一个自监督合成框架,旨在实现高效且专用的训练。更重要的是,我们设计了一致性控制模块,该模块由双目偏差强度指标和时间交互学习模块 TIL 组成,分别用于确保几何和时间一致性。我们将所提出的方法与各种基准方法进行了评估,结果展示了其优越的性能。
引用
@article{arxiv.2411.11934,
title = {SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input},
author = {Zhen Lv and Yangqi Long and Congzhentao Huang and Cao Li and Chengfei Lv and Hao Ren and Dian Zheng},
journal= {arXiv preprint arXiv:2411.11934},
year = {2025}
}
备注
website, see https://spatialdreamer.github.io