中文

基于混合注意力解耦蒸馏的长时程流式视频生成

计算机视觉与模式识别 2026-04-29 v2

摘要

流式视频生成 (SVG) 将预训练的双向视频扩散模型蒸馏到带有滑动窗口注意力 (SWA) 的自回归模型中。然而,SWA 在长视频生成过程中不可避免地丢失远程历史信息,且其计算开销仍是实时部署的关键挑战。本文提出了混合强制 (Hybrid Forcing) 方法,通过混合注意力设计联合优化时间信息保留与计算效率。首先,我们引入轻量级线性时间注意力以保留滑动窗口之外的长程依赖。具体而言,通过维护紧凑的键值状态,逐步吸收被驱逐的 token,实现几乎无额外内存和计算开销的时序上下文保留。其次,我们将块稀疏注意力融入局部滑动窗口,以减少短程建模中的冗余计算,将计算资源重新分配给更关键的依赖。最后,我们针对混合注意力设计引入解耦蒸馏策略。在稠密注意力下进行少步初始蒸馏,然后激活我们提出的线性时间和块稀疏注意力进行流式建模,确保优化稳定。大量实验在短时程和长时程视频生成基准上均表明,Hybrid Forcing 持续实现最前沿性能。值得注意的是,我们的模型在无量化或模型压缩的情况下,即可在单张 NVIDIA H100 GPU 上实现 29.5 FPS 的实时、无界限 832x480 视频生成。源码和训练好的模型已公开于 https://github.com/leeruibin/hybrid-forcing。

关键词

引用

@article{arxiv.2604.10103,
  title  = {Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation},
  author = {Ruibin Li and Tao Yang and Fangzhou Ai and Tianhe Wu and Shilei Wen and Bingyue Peng and Lei Zhang},
  journal= {arXiv preprint arXiv:2604.10103},
  year   = {2026}
}