LinGen:面向高分辨分钟级文本到视频生成的线性计算复杂度框架
摘要
文本到视频生成虽然提升了内容创建,但计算开销极高:扩散变换器(DiT)的计算成本随像素数量呈二次方增长。这使得分钟级视频生成极其昂贵,限制了大多数现有模型只能生成仅 10-20 秒的视频。我们提出一种线性计算复杂度文本到视频生成(LinGen)框架,其成本随像素数量呈线性增长。首次,LinGen 能在单张 GPU 上而不牺牲质量的情况下生成高分辨率分钟级视频。它将计算占主导且二次复杂度的自注意力块替换为一种线性复杂度块,称为 MATE,包含 MA 分支和 TE 分支。MA 分支针对短程至长程关联,结合双向 Mamba2 块、我们的旋转主扫描方法(Rotary Major Scan)以及针对长视频生成开发的 review tokens。TE 分支是一种新颖的 TEmporal Swin 注意力块,专注于相邻 token 之间以及中等范围 token 之间的时序关联。MATE 块解决了 Mamba 的邻接保持问题,并显著提高了生成视频的一致性。实验结果表明,LinGen 在视频质量上超过 DiT,获胜率达 75.6%,同时实现最高可达 15 倍(11.5 倍)FLOPs(延迟)降低。此外,无论是自动化指标还是人类评估,都显示我们的 LinGen-4B 在视频质量上与最先进的模型相当,分别相对于 Gen-3、LumaLabs 和 Kling 的获胜率为 50.5%、52.1%、49.1%。这为实现分钟级电影生成和实时交互式视频生成指明了道路。我们在项目网站提供了 68 秒视频生成结果及更多示例:https://lineargen.github.io/。
引用
@article{arxiv.2412.09856,
title = {LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity},
author = {Hongjie Wang and Chih-Yao Ma and Yen-Cheng Liu and Ji Hou and Tao Xu and Jialiang Wang and Felix Juefei-Xu and Yaqiao Luo and Peizhao Zhang and Tingbo Hou and Peter Vajda and Niraj K. Jha and Xiaoliang Dai},
journal= {arXiv preprint arXiv:2412.09856},
year = {2025}
}
备注
Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025