中文

SANA-Video:基于块线性扩散 Transformer 的高效视频生成

计算机视觉与模式识别 2025-10-14 v2 人工智能

摘要

我们推出了 SANA-Video,这是一个能够高效生成分辨率高达 720x1280 且时长可达分钟级视频的小型扩散模型。SANA-Video 以极快的速度合成了高分辨率、高质量的长视频,并具有强大的文本-视频对齐能力,可部署于 RTX 5090 GPU。两项核心设计确保了我们高效、有效且能生成长视频:(1) Linear DiT:我们利用线性注意力作为核心操作,鉴于视频生成中处理大量 token,这比普通注意力更高效。(2) 块线性注意力的常量内存 KV cache:我们通过采用由线性注意力累积特性导出的常量内存状态,设计了一种用于长视频生成的逐块自回归方法。该 KV cache 以固定的内存成本为 Linear DiT 提供全局上下文,消除了对传统 KV cache 的需求,并实现了高效的分钟级视频生成。此外,我们探索了有效的数据过滤器和模型训练策略,将训练成本缩减至在 64 个 H100 GPU 上的 12 天,仅为 MovieGen 成本的 1%。鉴于其低成本,SANA-Video 与现代最先进的小型扩散模型(例如,Wan 2.1-1.3B 和 SkyReel-V2-1.3B)相比实现了具有竞争力的性能,同时实测延迟快 16 倍。此外,SANA-Video 可以以 NVFP4 精度部署在 RTX 5090 GPU 上,将生成 5 秒 720p 视频的推理速度从 71 秒加速至 29 秒(2.4 倍加速)。总而言之,SANA-Video 实现了低成本、高质量的视频生成。

关键词

引用

@article{arxiv.2509.24695,
  title  = {SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer},
  author = {Junsong Chen and Yuyang Zhao and Jincheng Yu and Ruihang Chu and Junyu Chen and Shuai Yang and Xianbang Wang and Yicheng Pan and Daquan Zhou and Huan Ling and Haozhe Liu and Hongwei Yi and Hao Zhang and Muyang Li and Yukang Chen and Han Cai and Sanja Fidler and Ping Luo and Song Han and Enze Xie},
  journal= {arXiv preprint arXiv:2509.24695},
  year   = {2025}
}

备注

21 pages, 15 figures, 7 tables