中文

Snap Video:用于文本到视频合成的可扩展时空 Transformer

计算机视觉与模式识别 2024-02-23 v1 人工智能

摘要

当代的图像生成模型展现出了卓越的质量和多功能性。受这些优势的吸引,研究界将其重新用于生成视频。由于视频内容高度冗余,我们认为将图像模型的进展简单地引入视频生成领域会降低运动保真度、视觉质量并损害可扩展性。在这项工作中,我们构建了 Snap Video,这是一种以视频为先的模型,系统地解决了这些挑战。为此,我们首先扩展了 EDM 框架,以考虑空间和时间上冗余的像素,并自然地支持视频生成。其次,我们表明 U-Net(图像生成背后的主力模型)在生成视频时扩展性很差,需要大量的计算开销。因此,我们提出了一种新的基于 Transformer 的架构,其训练速度比 U-Net 快 3.31 倍(推理速度快约 4.5 倍)。这使我们能够首次高效地训练具有数十亿参数的文本到视频模型,在多个基准测试上达到 SOTA 结果,并生成具有更高视觉质量、时间一致性和运动复杂性的视频。用户研究表明,我们的模型以巨大优势优于最新方法。请访问我们的网站 https://snap-research.github.io/snapvideo/。

关键词

引用

@article{arxiv.2402.14797,
  title  = {Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis},
  author = {Willi Menapace and Aliaksandr Siarohin and Ivan Skorokhodov and Ekaterina Deyneka and Tsai-Shien Chen and Anil Kag and Yuwei Fang and Aleksei Stoliar and Elisa Ricci and Jian Ren and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2402.14797},
  year   = {2024}
}