中文

H-VFI:面向大运动视频的分层帧插值方法

计算机视觉与模式识别 2022-11-22 v1

摘要

借助神经网络的快速发展,近期的视频帧插值(VFI)方法取得了显著进步。然而,对于包含大运动的真实世界视频,它们仍力有不逮。大运动引起的复杂形变和/或遮挡使得视频帧插值成为极困难的问题。本文中,我们提出一种简单而有效的方案 H-VFI,以处理视频帧插值中的大运动。H-VFI 提出了一种分层视频插值 transformer(HVIT),以多尺度由粗到精策略学习可变形卷积核。所学可变形卷积核随后用于卷积输入帧以预测插值帧。从最小尺度开始,H-VFI 基于先前预测的卷积核、中间插值结果及来自 transformer 的分层特征,通过残差依次更新可变形卷积核。随后,由一 transformer 模块基于插值结果预测偏置与掩码以细化最终输出。这种渐进式近似的优势在于,可将大运动帧插值问题分解为若干相对简单的子任务,从而实现最终结果的高精度预测。本文另一值得注意的贡献是一个大规模高质量数据集 YouTube200K,其包含以高分辨率与高帧率捕获的呈现丰富场景的视频。在多个帧插值基准上的大量实验验证了 H-VFI 优于现有最先进方法,尤其针对大运动视频。

关键词

引用

@article{arxiv.2211.11309,
  title  = {H-VFI: Hierarchical Frame Interpolation for Videos with Large Motions},
  author = {Changlin Li and Guangyang Wu and Yanan Sun and Xin Tao and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2211.11309},
  year   = {2022}
}