中文

变权重分组查询注意力机制于 Transformer

计算与语言 2024-07-16 v1 人工智能

摘要

注意力机制是 Transformer 语言模型的基础模块。最近的研究表明,通过扩大模型规模可实现接近人类水平的性能。然而,随着规模化需求的增加和硬件内存限制的提升,这些模型的推理成本仍然较高。为降低推理时间,提出了多查询注意力 (MQA) 和分组查询注意力 (GQA)。本文提出一种分组查询注意力的变体,称为加权分组查询注意力 (WGQA)。我们为 T5 解码器注意力模块中的每个 key 和 value head引入新的可学习参数,使模型在微调期间能够进行加权平均。我们的模型在 GQA 上实现平均 0.53% 的性能提升,推理期间无需额外开销即可收敛至传统多头注意力 (MHA)。我们评估了这些参数的引入及随后的微调,表明训练期间模型能了解分组机制,从而提升性能。此外,我们通过比较 T5-small 与 T5-base 架构的结果,展示了我们方法中的比例规律。

关键词

引用

@article{arxiv.2407.10855,
  title  = {Weighted Grouped Query Attention in Transformers},
  author = {Sai Sena Chinnakonduru and Astarag Mohapatra},
  journal= {arXiv preprint arXiv:2407.10855},
  year   = {2024}
}