中文

用于视频帧插值的上下文感知合成

计算机视觉与模式识别 2018-03-30 v1

摘要

视频帧插值算法通常估计光流或其变体,然后利用它在两个连续原始帧之间引导中间帧的合成。为了处理遮挡等挑战,通常会估计两个输入帧之间的双向流,并使用它对输入帧进行扭曲和混合。然而,如何有效地混合两个扭曲后的帧仍然是一个具有挑战性的问题。本文提出了一种上下文感知合成方法,该方法不仅扭曲输入帧,还扭曲其逐像素上下文信息,并利用它们来插值生成高质量的中间帧。具体而言,我们首先使用预训练的神经网络为输入帧提取逐像素上下文信息。然后,我们采用最先进的光流算法估计它们之间的双向流,并预扭曲两个输入帧及其上下文图。最后,与混合预扭曲帧的常见方法不同,我们的方法将它们及其上下文图输入到视频帧合成神经网络中,以上下文感知的方式生成插值帧。我们的神经网络是全卷积的,并且是端到端训练的。实验表明,我们的方法能够处理遮挡和大运动等挑战性场景,并且优于代表性的最先进方法。

关键词

引用

@article{arxiv.1803.10967,
  title  = {Context-aware Synthesis for Video Frame Interpolation},
  author = {Simon Niklaus and Feng Liu},
  journal= {arXiv preprint arXiv:1803.10967},
  year   = {2018}
}

备注

CVPR 2018, http://graphics.cs.pdx.edu/project/ctxsyn