中文

面向 Transformer 的优化化分组查询注意力机制

机器学习 2024-06-24 v1

摘要

分组查询注意力(GQA)已被广泛采用于大语言模型(LLM)中,以缓解多头注意力(MHA)的复杂度。在将 MHA 转换为 GQA 时,MHA 中的相邻查询被均匀分割为若干组,每组共享值和键层。本文提出 AsymGQA,即一种基于激活信息的非对称分组 MHA 到 GQA 的方法,以实现更好的模型性能。我们的 AsymGQA 在相同的模型规模预算下优于 GQA。例如,AsymGQA LLaMA-2-7B 在 MMLU 上的准确率提升 7.5%。我们的方法解决了 GQA 在模型性能和硬件效率之间权衡的问题。

关键词

引用

@article{arxiv.2406.14963,
  title  = {Optimised Grouped-Query Attention Mechanism for Transformers},
  author = {Yuang Chen and Cheng Zhang and Xitong Gao and Robert D. Mullins and George A. Constantinides and Yiren Zhao},
  journal= {arXiv preprint arXiv:2406.14963},
  year   = {2024}
}

备注

Accepted at ICML2024 ES-FoMo-II Workshop