LDMVFI:基于潜在扩散模型的视频帧插值
图像与视频处理
2024-06-11 v3 计算机视觉与模式识别
摘要
现有视频帧插值(VFI)工作多采用深度神经网络,通过最小化其输出与真值帧间的 L1、L2 或深度特征空间距离(如 VGG 损失)进行训练。然而,近期工作表明这些度量并非感知 VFI 质量的良好指标。为开发面向感知的 VFI 方法,本文提出基于潜在扩散模型的 VFI——LDMVFI。该方法从生成视角出发,将 VFI 问题表述为条件生成问题。作为首个使用潜在扩散模型解决 VFI 的努力,我们在现有 VFI 文献常用测试集上对我们的方法进行了严格基准测试。我们的定量实验与用户研究表明,即便在高分辨率情形下,LDMVFI 也能以优于最先进方法的感知质量插值视频内容。我们的代码见 https://github.com/danier97/LDMVFI。
引用
@article{arxiv.2303.09508,
title = {LDMVFI: Video Frame Interpolation with Latent Diffusion Models},
author = {Duolikun Danier and Fan Zhang and David Bull},
journal= {arXiv preprint arXiv:2303.09508},
year = {2024}
}
备注
Accepted by AAAI 2024