适用于大运动帧插值的图像到视频扩散模型
计算机视觉与模式识别
2025-02-18 v3
摘要
随着视频生成模型的发展在最近几年显著进步,我们采用大规模图像到视频扩散模型进行视频帧插值。我们提出了一个条件编码器,用于适应面向大运动帧插值的图像到视频模型。为增强性能,我们集成了双分支特征提取器,并提出了一种跨帧注意力机制,有效捕获空间和时间信息,从而实现对中间帧的准确插值。我们的方法在Fréchet Video Distance (FVD)指标上表现出优异性能,尤其是在处理大运动场景时优于其他最先进的方法,突显了基于生成的方法在此领域的进步。
引用
@article{arxiv.2412.17042,
title = {Adapting Image-to-Video Diffusion Models for Large-Motion Frame Interpolation},
author = {Luoxu Jin and Hiroshi Watanabe},
journal= {arXiv preprint arXiv:2412.17042},
year = {2025}
}