中文

基于自适应卷积的视频帧插值

计算机视觉与模式识别 2017-03-23 v1

摘要

视频帧插值通常包含两个步骤:运动估计和像素合成。这种两步方法严重依赖于运动估计的质量。本文提出了一种鲁棒的视频帧插值方法,将这两个步骤合并为一个单一过程。具体而言,我们的方法将插值帧的像素合成视为对两帧输入帧的局部卷积。卷积核同时捕获了输入帧之间的局部运动和用于像素合成的系数。我们的方法采用深度全卷积神经网络为每个像素估计空间自适应卷积核。该深度神经网络可以使用广泛可用的视频数据直接进行端到端训练,无需任何难以获取的基准真值数据(如光流)。我们的实验表明,将视频插值表述为单一卷积过程使我们的方法能够优雅地处理遮挡、模糊和亮度突变等挑战,并实现高质量的视频帧插值。

关键词

引用

@article{arxiv.1703.07514,
  title  = {Video Frame Interpolation via Adaptive Convolution},
  author = {Simon Niklaus and Long Mai and Feng Liu},
  journal= {arXiv preprint arXiv:1703.07514},
  year   = {2017}
}

备注

CVPR 2017, http://graphics.cs.pdx.edu/project/adaconv