中文

基于扩散模型的视频插值

计算机视觉与模式识别 2024-04-02 v1

摘要

我们提出VIDIM,一种用于视频插值的生成模型,它根据起始帧和结束帧创建短视频。为了实现高保真度并生成输入数据中未见过的运动,VIDIM使用级联扩散模型首先在低分辨率下生成目标视频,然后在低分辨率生成视频的条件下生成高分辨率视频。我们将VIDIM与先前最先进的视频插值方法进行比较,并展示这些方法在底层运动复杂、非线性或模糊的大多数设置中如何失败,而VIDIM可以轻松处理此类情况。我们还展示了在起始帧和结束帧上的无分类器引导以及在不增加参数的情况下将超分辨率模型条件于原始高分辨率帧如何实现高保真结果。VIDIM采样速度快,因为它联合去噪所有待生成帧,每个扩散模型需要不到十亿个参数即可产生令人信服的结果,并且在参数数量增加时仍具有可扩展性和改进的质量。

关键词

引用

@article{arxiv.2404.01203,
  title  = {Video Interpolation with Diffusion Models},
  author = {Siddhant Jain and Daniel Watson and Eric Tabellion and Aleksander Hołyński and Ben Poole and Janne Kontkanen},
  journal= {arXiv preprint arXiv:2404.01203},
  year   = {2024}
}

备注

CVPR 2024, Project page at https://vidim-interpolation.github.io/