LongLive-2.0:面向长视频生成的 NVFP4 并行基础设施
摘要
我们提出了 LongLive-2.0,一种贯穿长视频生成完整训练与推理工作流的基于 NVFP4 的并行基础设施,旨在解决速度和内存瓶颈。在训练方面,我们引入了序列并行自回归(AR)训练,并将其实例化为 Balanced SP,它通过在每个 rank 上配对干净历史和带噪目标时间块,将高效的 teacher-forcing 布局与 SP 执行进行协同设计,从而实现自然的 teacher-forcing 掩码与 SP 感知的分块 VAE 编码。结合 NVFP4 精度,它降低了 GPU 内存开销,并加速了训练过程中的 GEMM 计算,且该计算的比例随视频长度的增加而增大。此外,我们展示了高质量的基础设施和数据集能够实现极其简洁的训练流水线。与依赖 ODE 初始化和后续分布匹配蒸馏(DMD)的现有 Self-Forcing 系列方法不同,LongLive-2.0 直接将扩散模型微调为长时、多镜头、交互式自回归(AR)扩散模型。它还可以通过独立的 LoRA 权重进一步转换为实时生成(4 到 2 个去噪步)。对于在 Blackwell GPU 上的推理,我们启用了 W4A4 NVFP4 推理,将 KV cache 量化为 NVFP4 以节省内存,并通过异步流式 VAE 解码提升端到端吞吐量。在非 Blackwell GPU 架构上,我们部署 SP 推理以匹配 Blackwell GPU 上的速度,同时量化的 KV cache 可以降低 SP 的 GPU 间通信。实验表明,训练加速高达 2.15 倍,推理加速达 1.84 倍。LongLive-2.0-5B 在取得强大基准性能的同时实现了 45.7 FPS 的推理。据我们所知,LongLive-2.0 是首个用于长视频生成的 NVFP4 训练和推理系统。
引用
@article{arxiv.2605.18739,
title = {LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation},
author = {Yukang Chen and Luozhou Wang and Wei Huang and Shuai Yang and Bohan Zhang and Yicheng Xiao and Ruihang Chu and Weian Mao and Qixin Hu and Shaoteng Liu and Yuyang Zhao and Huizi Mao and Ying-Cong Chen and Enze Xie and Xiaojuan Qi and Song Han},
journal= {arXiv preprint arXiv:2605.18739},
year = {2026}
}
备注
Code, model, and demos are available at https://github.com/NVlabs/LongLive