注意力方案混合(MoAS):学习在MHA、GQA与MQA之间路由
人工智能
2025-12-25 v1
摘要
Transformer模型中注意力机制的选择在建模质量与推理效率之间存在关键权衡。多头注意力(MHA)提供最佳质量,但在推理期间因大型Key-Value(KV)缓存存储需求而受限。多查询注意力(MQA)和分组查询注意力(GQA)降低了存储需求,但常以牺牲模型性能为代价。在本工作中,我们提出了注意力方案混合(MoAS),一种新型架构,通过学习的路由器为每个token动态选择最佳注意力方案(MHA、GQA或MQA)。我们展示了动态路由优于方案的静态平均,并在WikiText-2上实现了与MHA基线相当的性能,同时提供条件计算效率的潜力。实验结果显示,动态路由(验证损失2.3074)优于静态混合(2.3093),验证了所提出方法的有效性。我们的代码可在https://github.com/Esmail-ibraheem/Mixture-of-Attention-Schemes-MoAS获取。
引用
@article{arxiv.2512.20650,
title = {Mixture of Attention Schemes (MoAS): Learning to Route Between MHA, GQA, and MQA},
author = {Esmail Gumaan},
journal= {arXiv preprint arXiv:2512.20650},
year = {2025}
}
备注
5 pages