中文

ST-MFNet:一种用于帧插值的时空多流网络

计算机视觉与模式识别 2024-11-22 v2 图像与视频处理

摘要

视频帧插值(VFI)目前是一个十分活跃的研究课题,其应用涵盖计算机视觉、后期制作与视频编码。VFI 可能极具挑战性,尤其在包含大幅运动、遮挡或动态纹理的序列中,现有方法无法提供感知上鲁棒的插值性能。在此背景下,我们提出一种基于深度学习的新型 VFI 方法 ST-MFNet,其基于时空多流(Spatio-Temporal Multi-Flow)架构。ST-MFNet 采用一种新的多尺度多流预测器来估计多对一的中间流,并将其与常规的一对一光流结合,以捕捉大幅且复杂的运动。为增强对各种纹理的插值性能,还采用了 3D CNN 来建模扩展时间窗上的内容动态。此外,ST-MFNet 在最初为纹理合成开发的 ST-GAN 框架内训练,旨在进一步提升感知插值质量。我们的方法已得到全面评估——与十四种最先进的 VFI 算法比较——清晰表明 ST-MFNet 在多样且具有代表性的测试数据集上持续优于这些基准,在包含大幅运动与动态纹理的案例中 PSNR 提升高达 1.09dB。项目页面:https://danielism97.github.io/ST-MFNet。

关键词

引用

@article{arxiv.2111.15483,
  title  = {ST-MFNet: A Spatio-Temporal Multi-Flow Network for Frame Interpolation},
  author = {Duolikun Danier and Fan Zhang and David Bull},
  journal= {arXiv preprint arXiv:2111.15483},
  year   = {2024}
}

备注

Accepted in CVPR 2022