中文

用于视频帧修复的时间感知插值网络

计算机视觉与模式识别 2018-11-06 v2

摘要

我们提出了视频帧修复的首个深度学习解决方案,这是通用视频修复问题中一个具有挑战性的实例,可应用于视频编辑、篡改与取证。我们的任务比帧插值和视频预测更少歧义,因为我们同时拥有时间上下文和对未来部分的一瞥,从而能够更好地客观评估模型预测的质量。我们设计了一个由两个模块组成的流程:一个双向视频预测模块和一个时间感知帧插值模块。预测模块利用共享的基于卷积 LSTM 的编码器-解码器,对缺失帧做出两次中间预测,一次以前续帧为条件,另一次以后续帧为条件。插值模块将中间预测融合以形成最终结果。具体而言,它利用时间信息和来自视频预测模块的隐藏激活来解决预测之间的分歧。我们的实验表明,与最先进的视频预测方法和许多强帧修复基线相比,我们的方法产生了更准确、定性上更令人满意的结果。

关键词

引用

@article{arxiv.1803.07218,
  title  = {A Temporally-Aware Interpolation Network for Video Frame Inpainting},
  author = {Ximeng Sun and Ryan Szeto and Jason J. Corso},
  journal= {arXiv preprint arXiv:1803.07218},
  year   = {2018}
}