中文

Spava: 面向序列并行感知的长视频理解加速框架

计算机视觉与模式识别 2026-01-30 v1 人工智能 计算与语言

摘要

长视频推理效率仍是大型多模态模型 (LMM) 的关键瓶颈,主要由于注意力在预填阶段的密集计算所致。现有方法要么压缩视觉嵌入,要么在单 GPU 上应用稀疏注意力,导致加速有限或性能下降,限制了 LMM 处理更长、更复杂视频的能力。为克服这些问题,我们提出 Spava,一个面向序列并行的框架,通过优化注意力机制在多个 GPU 之间加速长视频推理。通过分布式近似注意力,Spava 减少计算量并提升并行度,使能够在不压缩的情况下高效处理更多视觉嵌入,从而提升任务性能。系统层面的优化,如负载均衡和融合前向传播,进一步发挥 Spava 的潜力,相较于 FlashAttn、ZigZagRing 和 APB,分别实现 12.72 倍、1.70 倍和 1.18 倍的加速,而不会带来显著的性能损失。代码已公开于 https://github.com/thunlp/APB。

关键词

引用

@article{arxiv.2601.21444,
  title  = {Spava: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention},
  author = {Yuxiang Huang and Mingye Li and Xu Han and Chaojun Xiao and Weilin Zhao and Ao Sun and Ziqi Yuan and Hao Zhou and Fandong Meng and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:2601.21444},
  year   = {2026}
}

备注

Preprint