中文

CascadeV:基于 Wurstchen 架构的视频生成实现

计算机视觉与模式识别 2025-01-29 v1

摘要

近年来,随着扩散模型在文本到图像(T2I)生成领域取得巨大成功,越来越多的注意力被引向其在文本到视频(T2V)应用中的潜力。然而,扩散模型的计算需求在生成高分辨率、高帧率视频时提出了重大挑战。本文提出了 CascadeV,一种能够生成领先水平 2K 分辨率视频的级联潜在扩散模型(LDM)。实验表明,我们的级联模型实现了更高的压缩比,显著降低了高质量视频生成的计算挑战。我们还实现了一种时空交替网格 3D 注意力机制,有效整合了空间和时间信息,确保生成视频帧之间的优异一致性。此外,本模型可与现有的 T2V 模型级联,理论上实现 4 倍分辨率或每秒帧数的提升,无需任何微调。我们的代码已公开于 https://github.com/bytedance/CascadeV。

关键词

引用

@article{arxiv.2501.16612,
  title  = {CascadeV: An Implementation of Wurstchen Architecture for Video Generation},
  author = {Wenfeng Lin and Jiangchuan Wei and Boyuan Liu and Yichen Zhang and Shiyue Yan and Mingyu Guo},
  journal= {arXiv preprint arXiv:2501.16612},
  year   = {2025}
}