用于视频帧插值的解缠运动建模
计算机视觉与模式识别
2024-12-20 v2
摘要
视频帧插值(VFI)旨在合成现有帧之间的中间帧,以增强视觉平滑性和质量。传统方法基于重建损失,而近期研究采用生成模型以获得更好的感知质量,但需要复杂的训练和大量计算成本进行像素空间建模。本文引入了解缠运动建模(MoMo),一种基于扩散的方法用于 VFI,通过聚焦于中间运动建模来提升视觉质量。我们提出了解缠的两阶段训练流程。在初始阶段,训练帧合成和流模型以生成准确的帧和最佳合成流。在后续阶段,我们引入运动扩散模型, incorporates our novel U-Net architecture specifically designed for optical flow to generate帧间双向流。通过学习更简单的低频运动表示,MoMo 在感知质量上优于像素空间建模方法,同时计算需求更低。在 various benchmarks 上,MoMo 在感知指标上超越了当前最先进的方法,展示了其在 VFI 中的高效与有效性。
引用
@article{arxiv.2406.17256,
title = {Disentangled Motion Modeling for Video Frame Interpolation},
author = {Jaihyun Lew and Jooyoung Choi and Chaehun Shin and Dahuin Jung and Sungroh Yoon},
journal= {arXiv preprint arXiv:2406.17256},
year = {2024}
}
备注
AAAI 2025