中文

通过帧间注意力提取运动与表观信息以实现高效视频帧插值

计算机视觉与模式识别 2023-03-07 v2

摘要

有效提取帧间运动与表观信息对视频帧插值(VFI)十分重要。先前工作或以混合方式提取两类信息,或为每个类型精心设计独立模块,导致表示歧义与低效率。本文提出一种新颖模块,通过统一操作显式提取运动与表观信息。具体而言,我们重新思考帧间注意力中的信息处理,并将其注意力图复用于表观特征增强与运动信息提取。此外,为高效VFI,我们所提模块可无缝集成到CNN与Transformer混合架构中。该混合流程既能缓解帧间注意力的计算复杂度,又能保留详细的低级结构信息。实验结果表明,对于固定与任意时间步插值,我们的方法在各数据集上均达到最先进性能。同时,相较于性能相近的模型,我们的方法具有更轻的计算开销。源代码与模型见https://github.com/MCG-NJU/EMA-VFI。

关键词

引用

@article{arxiv.2303.00440,
  title  = {Extracting Motion and Appearance via Inter-Frame Attention for Efficient Video Frame Interpolation},
  author = {Guozhen Zhang and Yuhan Zhu and Haonan Wang and Youxin Chen and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2303.00440},
  year   = {2023}
}

备注

Accepted by CVPR 2023