中文

AQUA:基于查询幅度的注意力机制,用于 LLM 推理中的内存与计算效率

机器学习 2025-09-16 v1 人工智能 计算与语言

摘要

注意力机制的二次复杂度仍是将大型语言模型(Large Language Model, LLM)扩展到更长上下文范围的根本性障碍,在计算和内存资源方面构成关键瓶颈。为此,我们提出 AQUA(Attention via QUery mAgnitudes),一种新型且高度灵活的近似策略,显著降低注意力计算成本,同时实现性能与效率之间的优雅权衡。Our 方法包含两个阶段:一个高效的离线步骤,通过在校准数据集上进行奇异值分解(SVD)计算出通用、语言无关的投影矩阵;以及一个在线推理步骤中,对查询向量与键向量进行投影,并依据查询的幅度动态选择稀疏子集维度。我们对 AQUA 提供了形式化的理论分析,确定了其计算效率超过标准注意力机制的盈亏平衡点。我们的实验在基于 Llama-3.1-8B 的最新模型上表明,注意力点积计算可降低 25%,而在广泛的基准测试中对性能影响不显著。我们进一步展示了 AQUA 的灵活性,通过将其与现有 token 驱逐方法(如 H2O)协同加速,或直接降低 KV 缓存内存规模,实现了对效率与精度之间可控平衡的支持,为大规模 LLM 推理提供了实用且强大的工具。

关键词

引用

@article{arxiv.2509.11155,
  title  = {AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs},
  author = {Santhosh G S and Saurav Prakash and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2509.11155},
  year   = {2025}
}