OSP-Next:高质量视频生成的稀疏序列并行、HiF8 量化与强化学习
计算机视觉与模式识别
2026-05-28 v1
摘要
扩散 Transformer 虽然实现了强大的视频生成质量,但全注意力的二次成本限制了效率。我们引入 OSP-Next,一个集成稀疏注意力、并行、量化和强化学习的高效文本到视频生成模型。OSP-Next 使用混合全稀疏注意力架构,其中稀疏组件采用 Skiparse-2D 注意力实现。该固定模式机制在空间维度上沿 token 级和 group 级稀疏注意力,利用局部性同时保持与 FlashAttention 内核的原生兼容性。基于 Skiparse-2D 注意力中重排等价性,我们进一步提出稀疏序列并行(SSP),在不同排位之间分割子序列并通过单次 All-to-All 通信切换稀疏模式。与 Ulysses 序列并行(SP) 相比,SSP 为稀疏注意力提供了原生并行策略,通信量降低 75%。OSP-Next 还整合 HiF8 量化,以实现 8 位量化和稀疏微调的稳定联合训练,并应用 Mix-GRPO 后训练提升稀疏模型性能。实验表明,OSP-Next 在 VBench 总体得分达 83.73%,超越了 Wan2.1 baseline。在 5 秒 720P 和 5 秒 768P 设置下,OSP-Next 在 NVIDIA H200 GPU 上实现最高 1.64 倍单卡加速和 1.52 倍 8 卡加速。此外,仅需 0.4% 的 VBench 总体得分下降,OSP-Next-HiF8 在单卡 Ascend 950PR 上分别实现 1.69 倍和 2.27 倍加速,展示了 OSP-Next 在不同硬件平台上的高效与性能。
引用
@article{arxiv.2605.28691,
title = {OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning},
author = {Yunyang Ge and Xianyi He and Zezhong Zhang and Bin Lin and Bin Zhu and Xinhua Cheng and Li Yuan},
journal= {arXiv preprint arXiv:2605.28691},
year = {2026}
}