中文

注意力方案混合(MoAS):学习在MHA、GQA与MQA之间路由

人工智能 2025-12-25 v1

摘要

Transformer模型中注意力机制的选择在建模质量与推理效率之间存在关键权衡。多头注意力(MHA)提供最佳质量,但在推理期间因大型Key-Value(KV)缓存存储需求而受限。多查询注意力(MQA)和分组查询注意力(GQA)降低了存储需求,但常以牺牲模型性能为代价。在本工作中,我们提出了注意力方案混合(MoAS),一种新型架构,通过学习的路由器为每个token动态选择最佳注意力方案(MHA、GQA或MQA)。我们展示了动态路由优于方案的静态平均,并在WikiText-2上实现了与MHA基线相当的性能,同时提供条件计算效率的潜力。实验结果显示,动态路由(验证损失2.3074)优于静态混合(2.3093),验证了所提出方法的有效性。我们的代码可在https://github.com/Esmail-ibraheem/Mixture-of-Attention-Schemes-MoAS获取。

关键词

引用

@article{arxiv.2512.20650,
  title  = {Mixture of Attention Schemes (MoAS): Learning to Route Between MHA, GQA, and MQA},
  author = {Esmail Gumaan},
  journal= {arXiv preprint arXiv:2512.20650},
  year   = {2025}
}

备注

5 pages