中文

压缩卷积注意力:在压缩潜空间中的高效注意力机制

计算与语言 2026-03-18 v2 人工智能

摘要

多头注意力(MHA)的二次计算复杂度以及线性增长的 KV 缓存,使得长上下文 transformer 模型在训练和部署方面成本高昂。已有方法如分组查询注意力(GQA)和多潜注意力(MLA)通过压缩缓存加快解码速度,但未显著降低计算复杂度,这直接决定了预填充和训练速度。我们提出压缩卷积注意力(CCA),一种新颖的注意力方法,通过对查询、键和值进行下投影,并在共享潜空间内完成整个注意力运算。这种简洁的设计能够在所需压缩因子下,同时大幅降低参数、KV 缓存和 FLOPs。由于 CCA 与头共享是正交的,我们将两者组合形成压缩卷积分组查询注意力(CCGQA),进一步紧凑计算-带宽的帕累托前沿,用户可根据 FLOP 或内存限制对压缩比例进行调节,而不牺牲性能。实验表明,在相同的 KV 缓存压缩比例下,CCGQA 在密集模型和混合专家(MoE)模型上均一致优于 GQA 和 MLA。此外,我们展示在 KV 缓存为 GQA 和 MLA 一半的情况下,CCGQA 在 MoE 模型上优于所有其他注意力方法,实现 8 倍 KV 缓存压缩且无需损失性能。CCA 和 CCGQA 显著降低了注意力的 FLOP 成本,从而在训练和预填充方面显著加快速度。在 H100 GPU 上,我们的融合 CCA/CCGQA 内核相较于 MHA,在序列长度为 16k 时将预填充延迟缩短约 1.7 倍,加速反向传播约 1.3 倍。

关键词

引用

@article{arxiv.2510.04476,
  title  = {Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space},
  author = {Tomas Figliolia and Nicholas Alonso and Rishi Iyer and Quentin Anthony and Beren Millidge},
  journal= {arXiv preprint arXiv:2510.04476},
  year   = {2026}
}