中文

LDMVFI:基于潜在扩散模型的视频帧插值

图像与视频处理 2024-06-11 v3 计算机视觉与模式识别

摘要

现有视频帧插值(VFI)工作多采用深度神经网络,通过最小化其输出与真值帧间的 L1、L2 或深度特征空间距离(如 VGG 损失)进行训练。然而,近期工作表明这些度量并非感知 VFI 质量的良好指标。为开发面向感知的 VFI 方法,本文提出基于潜在扩散模型的 VFI——LDMVFI。该方法从生成视角出发,将 VFI 问题表述为条件生成问题。作为首个使用潜在扩散模型解决 VFI 的努力,我们在现有 VFI 文献常用测试集上对我们的方法进行了严格基准测试。我们的定量实验与用户研究表明,即便在高分辨率情形下,LDMVFI 也能以优于最先进方法的感知质量插值视频内容。我们的代码见 https://github.com/danier97/LDMVFI。

关键词

引用

@article{arxiv.2303.09508,
  title  = {LDMVFI: Video Frame Interpolation with Latent Diffusion Models},
  author = {Duolikun Danier and Fan Zhang and David Bull},
  journal= {arXiv preprint arXiv:2303.09508},
  year   = {2024}
}

备注

Accepted by AAAI 2024