Gen-L-Video:基于时间协同去噪的多文本生成长视频生成
计算机视觉与模式识别
2023-05-30 v1
摘要
利用大规模图文数据集和扩散模型的进展,文本驱动的生成模型在图像生成与编辑领域取得了显著进展。本研究探索将文本驱动能力扩展至多文本条件下的长视频生成与编辑的潜力。当前视频生成与编辑方法虽具创新性,但往往局限于极短的视频(通常少于24帧)且仅支持单一文本条件。这些限制严重制约了其应用,因为现实世界中的视频通常由多个片段组成,每个片段承载不同的语义信息。为应对这一挑战,我们提出了一种称为 Gen-L-Video 的新范式,能够在无需额外训练的情况下,将现有的短视频扩散模型扩展用于生成和编辑包含数百帧且具多样语义片段的视频,同时保持内容一致性。我们实现了三种主流的文本驱动视频生成与编辑方法,并通过所提范式将其扩展至容纳更长且富含多种语义片段的视频。实验结果表明,我们的方法显著拓宽了视频扩散模型的生成与编辑能力,为未来研究与应用提供了新可能。代码见 https://github.com/G-U-N/Gen-L-Video。
引用
@article{arxiv.2305.18264,
title = {Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising},
author = {Fu-Yun Wang and Wenshuo Chen and Guanglu Song and Han-Jia Ye and Yu Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2305.18264},
year = {2023}
}
备注
The code is available at https://github.com/G-U-N/Gen-L-Video