LumosFlow:运动引导的长视频生成
计算机视觉与模式识别
2025-06-04 v1
摘要
由于在娱乐和模拟等领域的广泛应用,长视频生成受到了越来越多的关注。尽管取得了一定进展,但合成时间连贯且视觉引人入胜的长序列仍然是一个艰巨的挑战。传统方法通常通过顺序生成并拼接短片段来合成长视频,或者以分层方式生成关键帧然后对中间帧进行插值。然而,这两种方法仍然存在重大挑战,导致时间重复或不自然过渡等问题。在本文中,我们重新审视了分层长视频生成流程,并引入了 LumosFlow,一个显式引入运动指导的框架。具体而言,我们首先采用大运动文本到视频扩散模型(LMTV-DM)生成具有更大运动间隔的关键帧,从而确保生成的长视频的内容多样性。鉴于关键帧之间上下文过渡插值的复杂性,我们进一步将中间帧插值分解为运动生成和事后细化。对于每一对关键帧,潜在光流扩散模型(LOF-DM)合成复杂且大运动的光流,而 MotionControlNet 随后对变形结果进行细化以增强质量并指导中间帧生成。与传统的视频帧插值相比,我们实现了 15 倍插值,确保了相邻帧之间合理且连续的运动。实验表明,我们的方法能够生成具有连贯运动和外观的长视频。代码和模型将在被接受后公开。我们的项目页面:https://jiahaochen1.github.io/LumosFlow/
引用
@article{arxiv.2506.02497,
title = {LumosFlow: Motion-Guided Long Video Generation},
author = {Jiahao Chen and Hangjie Yuan and Yichen Qian and Jingyun Liang and Jiazheng Xing and Pengwei Liu and Weihua Chen and Fan Wang and Bing Su},
journal= {arXiv preprint arXiv:2506.02497},
year = {2025}
}