中文

运动感知视频帧插值

计算机视觉与模式识别 2024-02-06 v1

摘要

视频帧插值方法致力于在现有帧之间生成新帧,旨在提高视频的帧率。然而,在涉及遮挡和不连续运动的挑战性场景中,当前方法容易产生图像模糊和伪影。此外,它们通常依赖于光流估计,这增加了建模复杂度和计算成本。为解决这些问题,我们提出了一种运动感知视频帧插值(MA-VFI)网络,通过引入一种新颖的层级金字塔模块,直接从连续帧中估计中间光流。该模块不仅利用不同的感受野从输入帧中提取全局语义关系和空间细节,使模型能够捕捉复杂的运动模式,还有效降低了所需的计算成本和复杂度。随后,提出了一种跨尺度运动结构,利用提取的特征来估计和细化中间光流图。这种方法促进了输入帧特征与光流图在帧插值过程中的相互作用,显著提高了中间光流描述的精度。最后,精心设计了一种以中间光流为核心的判别性损失,作为巧妙的引导机制来指导中间光流的预测,从而大幅提升了中间光流映射的精度。实验表明,MA-VFI 在多个数据集上优于多种代表性 VFI 方法,并在保持优异效能的同时提升了效率。

关键词

引用

@article{arxiv.2402.02892,
  title  = {Motion-Aware Video Frame Interpolation},
  author = {Pengfei Han and Fuhua Zhang and Bin Zhao and Xuelong Li},
  journal= {arXiv preprint arXiv:2402.02892},
  year   = {2024}
}