RRAttention:基于每头轮转稀疏注意力的动态块稀疏注意力用于长上下文推理
计算与语言
2026-02-06 v1
摘要
注意力机制的二次复杂度是大型语言模型处理长上下文的关键瓶颈。虽然动态稀疏注意力方法提供了输入适应的效率,但面临根本性权衡:需要预处理、缺乏全局评估、违反查询独立性,或计算开销高。我们提出 RRAttention,一种新型动态稀疏注意力方法,通过头 轮转(RR)抽样策略同时实现所有理想属性。在每个 stride 中,RRAttention 通过在注意力头之间轮转查询抽样位置,保持查询独立性,同时通过 stride 级别聚合实现高效全局模式发现。我们的方法将复杂度从 降低到 ,并采用自适应 Top- 选择以实现最佳稀疏性。对自然语言理解(HELMET)和多模态视频理解(Video-MME)进行大量实验,表明 RRAttention 在计算仅半量的注意力块时即可恢复超过 99% 的完整注意力性能,在 128K 上下文长度下实现 2.4 加速,并优于现有动态稀疏注意力方法。
引用
@article{arxiv.2602.05853,
title = {RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference},
author = {Siran Liu and Guoxia Wang and Sa Wang and Jinle Zeng and HaoYang Xie and Siyu Lou and JiaBin Yang and DianHai Yu and Haifeng Wang and Chao Yang},
journal= {arXiv preprint arXiv:2602.05853},
year = {2026}
}