中文

适用于大运动帧插值的图像到视频扩散模型

计算机视觉与模式识别 2025-02-18 v3

摘要

随着视频生成模型的发展在最近几年显著进步,我们采用大规模图像到视频扩散模型进行视频帧插值。我们提出了一个条件编码器,用于适应面向大运动帧插值的图像到视频模型。为增强性能,我们集成了双分支特征提取器,并提出了一种跨帧注意力机制,有效捕获空间和时间信息,从而实现对中间帧的准确插值。我们的方法在Fréchet Video Distance (FVD)指标上表现出优异性能,尤其是在处理大运动场景时优于其他最先进的方法,突显了基于生成的方法在此领域的进步。

关键词

引用

@article{arxiv.2412.17042,
  title  = {Adapting Image-to-Video Diffusion Models for Large-Motion Frame Interpolation},
  author = {Luoxu Jin and Hiroshi Watanabe},
  journal= {arXiv preprint arXiv:2412.17042},
  year   = {2025}
}