中文

ImmersePro:通过隐式视差学习实现端到端立体视频合成

计算机视觉与模式识别 2024-10-02 v1

摘要

我们介绍了\textit{ImmersePro},一个专门设计用于将单视点视频转换为立体视频的创新框架。该框架利用一种新颖的双分支架构,包含一个视差分支和一个上下文分支,通过利用时空注意力机制处理视频数据。\textit{ImmersePro}采用隐式视差引导,能够从视频序列生成立体对,而无需显式的视差图,从而减少了与视差估计模型相关的潜在误差。除了技术进步之外,我们还介绍了YouTube-SBS数据集,这是一个从YouTube收集的包含423个立体视频的综合数据集。该数据集规模空前,包含超过700万个立体对,旨在促进立体视频生成模型的训练和基准测试。我们的实验证明了\textit{ImmersePro}在生成高质量立体视频方面的有效性,与现有方法相比有显著改进。与最佳竞争对手stereo-from-mono相比,我们在L1、SSIM和PSNR指标上分别定量提升了11.76%、6.39%和5.10%。

关键词

引用

@article{arxiv.2410.00262,
  title  = {ImmersePro: End-to-End Stereo Video Synthesis Via Implicit Disparity Learning},
  author = {Jian Shi and Zhenyu Li and Peter Wonka},
  journal= {arXiv preprint arXiv:2410.00262},
  year   = {2024}
}