中文

基于结构-运动迭代融合的视频帧插值方法

计算机视觉与模式识别 2021-05-13 v1

摘要

视频帧插值旨在相邻帧之间合成不存在的图像,以提供平滑且一致的视觉体验。解决这一极具挑战性任务的两类方法是基于光流的方法与基于核的方法。在现有工作中,基于光流的方法能提供准确的逐点运动描述,但缺乏对物体结构的约束;相反,基于核的方法侧重于结构对齐,其依赖于语义与表观特征,但往往使结果模糊。基于这些观察,我们提出了一种基于结构-运动的迭代融合方法。该框架是一个端到端可学习的双阶段结构。首先,分别通过基于结构与基于运动的学习分支合成插值帧,随后通过时空特征整合建立迭代细化模块。受观众对前景与背景物体具有不同视觉偏好的观察启发,我们首次提出在视频帧插值任务的评估过程中使用显著性掩码。在三个典型基准上的实验结果表明,即便我们的模型仅使用其他方法十分之一的数据进行训练,所提方法在所有评价指标上均优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.2105.05353,
  title  = {Video Frame Interpolation via Structure-Motion based Iterative Fusion},
  author = {Xi Li and Meng Cao and Yingying Tang and Scott Johnston and Zhendong Hong and Huimin Ma and Jiulong Shan},
  journal= {arXiv preprint arXiv:2105.05353},
  year   = {2021}
}

备注

4 pages, 3 figures