CompactAttention:基于 Block-Union KV Selection 加速分块预填充
计算与语言
2026-05-19 v1
摘要
分块预填充已成为长上下文大型语言模型中广泛采用的服务策略,但在此场景下高效注意力计算仍具有挑战。现有稀疏注意力方法主要为单次预填充设计,难以有效转化为分块预填充:块稀疏内核在查询长度受块大小限制时效率下降,细粒度模式搜索在每个块重复累积 KV 缓存时开销巨大。QUOKA 等近期方法直接针对分块预填充,避免稀疏内核开销,但依赖查询抽样的 token 级 KV 选择,可能遗漏查询特定的 KV 条目并引入显式 KV 复制开销。为此,我们提出 CompactAttention,一种基于 Block-Union KV Selection 的分块预填充注意力机制。CompactAttention 将 2D 块稀疏掩码视为 KV 选择信号而非直接的稀疏内核执行计划,并通过 Q-block 合并和 intra-group 合并将其转换为 GQA 感知的 per-group KV block 表。该构建在分页执行约束下产生保留输入掩码选中所有 KV blocks 的最小 block 表,使所选 KV blocks 可原地访问,无需显式 KV 压缩。在 LLaMA-3.1-8B-Instruct 上,CompactAttention 在 RULER 基准上保持接近密集注意力的准确度,同时在 128K 上下文长度下实现最高可达 的注意力加速。
引用
@article{arxiv.2605.16839,
title = {CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection},
author = {Jiwon Song and Dongwon Jo and Beomseok Kang and Jae-Joon Kim},
journal= {arXiv preprint arXiv:2605.16839},
year = {2026}
}