基于广义可变形卷积的视频帧插值
计算机视觉与模式识别
2021-03-19 v3
摘要
视频帧插值旨在从邻近源帧合成中间帧,同时保持空间与时间一致性。现有的基于深度学习的视频帧插值方法可大致分为两类:基于光流的方法与基于核的方法。基于光流方法的性能常因运动模型过度简化导致光流图估计不准而受损,而基于核方法的性能则往往受限于核形状的刚性。为解决这些限制性能的问题,本文提出一种称为广义可变形卷积的新机制,该机制能以数据驱动方式有效学习运动信息,并在时空中自由选取采样点。我们进一步基于该机制开发了一种新的视频帧插值方法。大量实验表明,新方法在性能上优于当前最优方法,尤其在处理复杂运动时。
引用
@article{arxiv.2008.10680,
title = {Video Frame Interpolation via Generalized Deformable Convolution},
author = {Zhihao Shi and Xiaohong Liu and Kangdi Shi and Linhui Dai and Jun Chen},
journal= {arXiv preprint arXiv:2008.10680},
year = {2021}
}
备注
13pages, journal