中文

用于视频帧插值的解缠运动建模

计算机视觉与模式识别 2024-12-20 v2

摘要

视频帧插值(VFI)旨在合成现有帧之间的中间帧,以增强视觉平滑性和质量。传统方法基于重建损失,而近期研究采用生成模型以获得更好的感知质量,但需要复杂的训练和大量计算成本进行像素空间建模。本文引入了解缠运动建模(MoMo),一种基于扩散的方法用于 VFI,通过聚焦于中间运动建模来提升视觉质量。我们提出了解缠的两阶段训练流程。在初始阶段,训练帧合成和流模型以生成准确的帧和最佳合成流。在后续阶段,我们引入运动扩散模型, incorporates our novel U-Net architecture specifically designed for optical flow to generate帧间双向流。通过学习更简单的低频运动表示,MoMo 在感知质量上优于像素空间建模方法,同时计算需求更低。在 various benchmarks 上,MoMo 在感知指标上超越了当前最先进的方法,展示了其在 VFI 中的高效与有效性。

关键词

引用

@article{arxiv.2406.17256,
  title  = {Disentangled Motion Modeling for Video Frame Interpolation},
  author = {Jaihyun Lew and Jooyoung Choi and Chaehun Shin and Dahuin Jung and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2406.17256},
  year   = {2024}
}

备注

AAAI 2025