基于双向扩散采样器的视频插值提升
计算机视觉与模式识别
2025-03-04 v3 人工智能
机器学习
摘要
近期大规模文本到视频(Text-to-video, T2V)和图像到视频(Image-to-video, I2V)扩散模型的进展显著提升了视频生成,尤其在关键帧插值方面表现突出。然而,当前的图像到视频扩散模型虽在单条件帧生成方面强大,但需为双帧(起始帧与结束帧)条件生成做适配,这对于有效的受限插值至关重要。不幸的是,现有方法通常并行融合前向和后向路径,常出现离群问题,导致生成伪影或需要多次迭代重加噪。本文引入一种新颖的双向采样策略,以无需大量重加噪或微调即可解决上述离群问题。我们的方法依据起始帧和结束帧分别沿前向和后向路径进行顺序采样,确保中间帧的生成更具一致性且符合分布。此外,我们融合了先进的引导技术,包括 CFG++ 和 DDS,进一步提升插值过程。通过整合这些技术,我们的方法实现了最先进的性能,高效生成高质量、平滑的关键帧间视频。在单张 3090 GPU 上,本方法仅用 195 秒即可插值 25 帧 1024×576 分辨率的视频,成为关键帧插值领域的领先解决方案。
引用
@article{arxiv.2410.05651,
title = {ViBiDSampler: Enhancing Video Interpolation Using Bidirectional Diffusion Sampler},
author = {Serin Yang and Taesung Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2410.05651},
year = {2025}
}
备注
ICLR 2025; Project page: https://vibidsampler.github.io/