中文

用于模糊视频帧插值的三阶段级联框架

计算机视觉与模式识别 2023-10-10 v1

摘要

模糊视频帧插值(BVFI)旨在从低帧率模糊视频生成高帧率清晰视频,是计算机视觉领域中一个具挑战性但重要的课题。模糊视频不仅像清晰视频一样提供空间与时间信息,还包含隐藏于每帧模糊帧中的额外运动信息。然而,现有BVFI方法通常未能充分利用所有有价值信息,最终制约了其性能。本文提出一种简单的端到端三阶段框架,以充分挖掘模糊视频中的有用信息。帧插值阶段设计时序可变形网络,直接从模糊输入中采样有用信息并合成任意时间间隔的中间帧。时序特征融合阶段通过双向循环可变形对齐网络为目标帧探索长期时序信息。去模糊阶段应用受Transformer赋能的泰勒近似网络递归恢复高频细节。所提三阶段框架对各模块任务分配清晰且具良好可扩展性,其有效性由各类实验结果证实。我们在四个基准上评估模型,包括Adobe240数据集、GoPro数据集、YouTube240数据集与Sony数据集。定量与定性结果表明我们的模型优于现有SOTA方法。此外,在真实世界模糊视频上的实验也表明模型具有良好的泛化能力。

关键词

引用

@article{arxiv.2310.05383,
  title  = {Three-Stage Cascade Framework for Blurry Video Frame Interpolation},
  author = {Pengcheng Lei and Zaoming Yan and Tingting Wang and Faming Fang and Guixu Zhang},
  journal= {arXiv preprint arXiv:2310.05383},
  year   = {2023}
}