中文

用于高效视频帧插值的前向渐进运动上下文精炼网络

计算机视觉与模式识别 2022-11-14 v1

摘要

近来,基于光流帧插值的方法通过先建模目标帧与输入帧之间的光流,再构建合成网络生成目标帧,取得了巨大成功。然而,上述级联架构会导致模型尺寸大、推理延迟高,阻碍其在移动端与实时应用中的部署。为解决该问题,我们提出一种新颖的渐进运动上下文精炼网络(PMCRNet),联合预测运动场与图像上下文以提升效率。不同于其他直接从深层特征合成目标帧的方法,我们探索通过借用相邻输入帧的已有纹理来简化帧插值任务,这意味着我们PMCRNet各金字塔层级的解码器仅需更新更易处理的中间光流、遮挡合并掩码与图像残差。此外,我们引入一种新的退火多尺度重建损失,以更好地引导这一高效PMCRNet的学习过程。在多个基准上的实验表明,所提方法不仅取得了优异的定量与定性结果,还显著减小了现有模型尺寸与运行时间。

关键词

引用

@article{arxiv.2211.06024,
  title  = {Progressive Motion Context Refine Network for Efficient Video Frame Interpolation},
  author = {Lingtong Kong and Jinfeng Liu and Jie Yang},
  journal= {arXiv preprint arXiv:2211.06024},
  year   = {2022}
}

备注

Accepted by IEEE SPL