中文

一种无需光流的多入单出视频帧插值网络

计算机视觉与模式识别 2023-12-06 v3 人工智能

摘要

一般而言,基于深度学习的视频帧插值(VFI)方法主要聚焦于估计两输入帧之间的运动向量并将其扭曲至目标时刻。尽管该方法在两输入帧间线性运动上表现出令人印象深刻的性能,但在处理遮挡与非线性运动时存在局限。近来,生成模型被应用于 VFI 以解决这些问题。然而,由于 VFI 并非聚焦于生成可信图像、而是预测两给定帧之间的准确中间帧的任务,性能局限依然存在。本文中,我们提出一种基于多入单出(MISO)的 VFI 方法,其不依赖运动向量估计,从而能有效建模遮挡与非线性运动。此外,我们引入一种新颖的运动感知损失,使 MISO-VFI 能更好地捕捉视频帧内的时空相关性。我们的 MISO-VFI 方法在 VFI 基准 Vimeo90K、Middlebury 和 UCF101 上取得了最先进结果,与现有方法相比存在显著性能差距。

关键词

引用

@article{arxiv.2311.11602,
  title  = {A Multi-In-Single-Out Network for Video Frame Interpolation without Optical Flow},
  author = {Jaemin Lee and Minseok Seo and Sangwoo Lee and Hyobin Park and Dong-Geol Choi},
  journal= {arXiv preprint arXiv:2311.11602},
  year   = {2023}
}

备注

Discovering a problem with the manuscript