中文

VSPrefill:轻量索引下的垂直斜线稀疏注意力用于长上下文填充

机器学习 2026-03-06 v1 人工智能

摘要

自注意力在 prefill 阶段的二次复杂度阻碍了大型语言模型的长上下文推理。现有稀疏注意力方法在上下文适应性、采样开销和微调成本之间存在权衡。我们提出 VSPrefill 机制,要求轻量级训练,使用注意力分布中的垂直斜线结构模式。我们的紧凑 VSIndexer 模块从 key-value 表示(增强后)中预测垂直列和斜对角线的上下文感知重要性得分。该方法在不修改 backbone 参数的前提下,以线性复杂度构建稀疏掩码。在推理期间,采用自适应累积阈值策略为每个层分配稀疏性预算,同时通过融合内核执行注意力,实现动态索引合并。我们在 Qwen3-4B-Instruct 和 LLaMA-3.1-8B-Instruct 上通过 LongBench 和 RULER 基准测试进行评估。VSPrefill 在保持 98.35% 完整注意力准确率的同时,实现了在 128k 上下文长度下平均 4.95 倍的加速。这一结果在准确率与效率之间的权衡上建立了新的 Pareto 前沿。

关键词

引用

@article{arxiv.2603.04460,
  title  = {VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling},
  author = {Chen Guanzhong},
  journal= {arXiv preprint arXiv:2603.04460},
  year   = {2026}
}