基于特征传播的长时视频帧插值
计算机视觉与模式识别
2022-03-30 v1
摘要
视频帧插值(VFI)工作通常通过先估计输入间的运动,再用估计的运动将输入扭曲至目标时间来预测中间帧。然而,当输入序列间的时间距离增大时,该方法并非最优,因为现有运动估计模块无法有效处理大运动。因此,VFI 工作在较小帧间隙时表现良好,而随着帧间隙增大表现变差。本工作中,我们提出一种新框架以解决该问题。我们认为当输入间存在较大间隙时,与其估计终将导致不准确插值的非精确运动,不如以另一输入为参考,从输入的一侧安全地传播至一个可靠的时间帧。随后,由于时间间隙现已缩小,其余中间帧可使用标准方法插值。为此,我们通过将经典特征级预测扩展为一种新颖的运动到特征方法,提出了一个传播网络(PNet)。为求完备,我们采用一个简单插值模型与 PNet 作为完整模型,并设计了一个简单流程以端到端方式训练该完整模型。在多个基准数据集上的实验结果证实了我们的方法相较于最先进方法在长时 VFI 上的有效性。
引用
@article{arxiv.2203.15427,
title = {Long-term Video Frame Interpolation via Feature Propagation},
author = {Dawit Mureja Argaw and In So Kweon},
journal= {arXiv preprint arXiv:2203.15427},
year = {2022}
}
备注
Accepted to CVPR 2022