StreamingT2V:基于文本的一致、动态且可扩展的长视频生成
计算机视觉与模式识别
2025-04-17 v2 人工智能
计算与语言
机器学习
多媒体
图像与视频处理
摘要
文本到视频扩散模型能够生成遵循文本指令的高质量视频,使得创建多样化和个性化的内容变得容易。然而,现有方法主要集中于高质量短视频生成(通常为 16 或 24 帧),在直接扩展到长视频合成情况时会出现明显的硬切。为了克服这些限制,我们引入了 StreamingT2V,这是一种用于生成 80、240、600、1200 或更多帧且过渡平滑的长视频自回归方法。其关键组件是: 短期记忆块,称为条件注意力模块(CAM),它通过注意力机制将当前生成条件化于从前一个块提取的特征,从而实现一致的块过渡; 长期记忆块,称为外观保留模块,它从第一个视频块中提取高层场景和对象特征,以防止模型遗忘初始场景; 随机混合方法,使得能够自回归地将视频增强器应用于无限长视频,且块之间无不一致性。实验表明,StreamingT2V 生成的视频具有高运动量。相比之下,所有竞争性图像到视频方法在以自回归方式直接应用时都容易出现视频停滞。因此,我们通过 StreamingT2V 提出了一种高质量的无缝文本到长视频生成器,在一致性和运动方面均优于竞争方法。我们的代码将在以下网址提供:https://github.com/Picsart-AI-Research/StreamingT2V
引用
@article{arxiv.2403.14773,
title = {StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text},
author = {Roberto Henschel and Levon Khachatryan and Hayk Poghosyan and Daniil Hayrapetyan and Vahram Tadevosyan and Zhangyang Wang and Shant Navasardyan and Humphrey Shi},
journal= {arXiv preprint arXiv:2403.14773},
year = {2025}
}
备注
https://github.com/Picsart-AI-Research/StreamingT2V