SPLA:用于长序列建模的稀疏块加线性注意力
计算与语言
2026-02-02 v1
摘要
块级稀疏注意力在处理长序列建模时可获得显著的效率提升,但现有方法常因完全丢弃未选中块而导致选择保真度低和累积性上下文损失。为此,我们引入稀疏加线性注意力(SPLA),一种框架,利用源自二阶泰勒展开的选择度量,准确识别用于精确注意力的相关块。与放弃剩余“长尾”不同,SPLA 通过残差线性注意力(RLA)模块将未选中块压缩为紧凑的循环状态。关键在于,为避免IO开销,我们推导了基于减法的RLA优化公式——计算残差为全局线性注意力与选中线性注意力之差——确保在推理期间未选中块无需被显式访问。我们的实验表明,SPLA 在持续预训练任务中缩小了与稠密注意力模型的性能差距,在如RULER等长序列基准上实现超越,同时保持竞争的常规知识和推理能力。
引用
@article{arxiv.2601.22379,
title = {SPLA: Block Sparse Plus Linear Attention for Long Context Modeling},
author = {Bailin Wang and Dan Friedman and Tao Lei and Chong Wang},
journal= {arXiv preprint arXiv:2601.22379},
year = {2026}
}
备注
v1