中文

StereoPilot:基于生成先验的统一高效立体视频转换

计算机视觉与模式识别 2025-12-19 v1

摘要

Stereoscopic displays(包括 VR 头显和 3D 电影)的快速发展导致对高质量立体视频内容需求不断增加。然而,3D 视频的生产成本高昂且复杂,而单眼到立体的自动转换受限于多阶段“Depth-Warp-Inpaint”(DWI)管道的局限性。该范式 suffer 从于误差传播、深度歧义以及平行立体配置和收敛立体配置之间的格式不一致。为解决这些挑战,我们引入了 UniStereo——首个大规模统一立体视频转换数据集,涵盖两种立体格式,旨在实现公平基准测试和稳健模型训练。基于该数据集,我们提出 StereoPilot——一个高效的前馈模型,直接合成目标视图,而无需依赖显式深度图或迭代扩散采样。配备可学习的域切换器和循环一致性损失,StereoPilot 能无缝适应不同立体格式并实现更好的一致性。大量实验表明,StereoPilot 在视觉保真度和计算效率方面均显著优于最先进的方法。项目页面:https://hit-perfect.github.io/StereoPilot/。

关键词

引用

@article{arxiv.2512.16915,
  title  = {StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors},
  author = {Guibao Shen and Yihua Du and Wenhang Ge and Jing He and Chirui Chang and Donghao Zhou and Zhen Yang and Luozhou Wang and Xin Tao and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2512.16915},
  year   = {2025}
}