中文

VFIMamba:基于状态空间模型的视频帧插值

计算机视觉与模式识别 2024-10-11 v2 人工智能

摘要

帧间建模是生成中间帧用于视频帧插值(VFI)的关键技术。当前方法主要依赖卷积或注意力模型,往往要么感受野不足,要么计算开销巨大。最近,针对长序列建模涌现出选择性状态空间模型(S6),其既具有线性复杂度,又具数据依赖建模能力。本文提出VFIMamba,一种新颖的帧插值方法,通过运用S6模型实现高效且动态的帧间建模。我们引入混合SSM块(MSB),该块首先以交错方式重新排列相邻帧的token,然后应用多方向S6建模。此设计既促进了跨帧信息传递,又保持了线性复杂度。此外,我们引入一种新颖的课程学习策略,逐步培养模型在不同运动幅度下的帧间动态建模能力,充分发挥S6模型的潜力。实验结果表明,我们的方法在多个基准测试中实现了最先进的性能,尤其在高分辨率场景中表现尤为突出。在X-TEST数据集上,VFIMamba对4K帧提升了0.80 dB,对2K帧提升了0.96 dB。

关键词

引用

@article{arxiv.2407.02315,
  title  = {VFIMamba: Video Frame Interpolation with State Space Models},
  author = {Guozhen Zhang and Chunxu Liu and Yutao Cui and Xiaotong Zhao and Kai Ma and Limin Wang},
  journal= {arXiv preprint arXiv:2407.02315},
  year   = {2024}
}