通过逐帧条件驱动的视频生成实现生成式中间帧插值
计算机视觉与模式识别
2024-12-17 v1
摘要
生成式中间帧插值旨在利用两个关键帧作为输入来生成中间帧序列。尽管视频生成模型取得了显著进展,但由于两个关键帧之间的插值路径不明确,生成式中间帧插值在保持时间稳定性方面仍面临挑战。当输入帧之间存在较大的运动间隙时,这一问题尤为严重。在本文中,我们提出了一种简单而高效的逐帧条件驱动视频生成(FCVG)方法,该方法显著增强了插值视频帧的时间稳定性。具体来说,我们的FCVG为每一帧提供了显式条件,使得识别两个输入帧之间的插值路径变得更加容易,从而确保生成视觉上合理的视频帧在时间上稳定。为了实现这一点,我们建议从两个输入帧中提取匹配的线条,然后可以逐帧轻松插值,这些线条作为逐帧条件无缝集成到现有的视频生成模型中。在涵盖自然景观、复杂人体姿态、相机运动和动画等多种场景的广泛评估中,现有方法通常表现出帧间不连贯的过渡。相比之下,我们的FCVG展示了使用线性和非线性插值曲线生成时间稳定视频的能力。我们的项目页面和代码可在\url{https://fcvg-inbetween.github.io/}获取。
引用
@article{arxiv.2412.11755,
title = {Generative Inbetweening through Frame-wise Conditions-Driven Video Generation},
author = {Tianyi Zhu and Dongwei Ren and Qilong Wang and Xiaohe Wu and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2412.11755},
year = {2024}
}