中文

Loki:基于低秩键的高效稀疏注意力

机器学习 2024-11-11 v2

摘要

大语言模型(LLM)的推理在序列长度较大时会涉及高昂的计算和内存成本。特别是,LLM 推理中使用的自注意力机制在这些成本中占据重要比重,这催生了对自注意力计算进行近似以降低成本的兴趣。本文提出通过聚焦注意力块中计算的键向量维度来近似自注意力。我们的分析表明,键向量在多个数据集和模型中均存在显著低维空间。利用这一发现,我们提出了 Loki,这是一种新颖的稀疏注意力方法,基于注意力得分在低维空间中对 KV 缓存中的标记进行排序和选择。我们的评估显示,Loki 由于数据移动(加载/存储)和计算成本的减少,能够加快注意力计算,同时比其他流行的近似方法在保持模型效果方面更优。

关键词

引用

@article{arxiv.2406.02542,
  title  = {Loki: Low-rank Keys for Efficient Sparse Attention},
  author = {Prajwal Singhania and Siddharth Singh and Shwai He and Soheil Feizi and Abhinav Bhatele},
  journal= {arXiv preprint arXiv:2406.02542},
  year   = {2024}
}

备注

Proceedings of the Thirty-Eighth Annual Conference on Neural Information Processing Systems (Main Conference Track)