高效多头注意力的自适应头预算
机器学习
2026-04-27 v1
摘要
Transformer 已成为跨越广泛领域的主导架构,主要归功于多头注意力在捕获多样化表示子空间方面的有效性。然而,标准多头注意力对每一输入统一激活所有注意力头,无论任务需求或输入复杂度如何。在许多情况下,尤其是对于粗粒度任务如文本分类,相关信息往往是全局的,不需要完整的注意力头多样性。因此,使用固定数量的注意力头会引入不必要的计算成本,或在资源分配不匹配输入时导致次优性能。为此,我们引入 BudgetFormer,一种配备自适应多头注意力机制的 Transformer 架构,动态分配计算资源。我们的 метод学习为每个输入分配对应的注意力头数(head budget),并学习选择最具信息量的注意力头的相关性分布。我们还提出一种基于探索与开发权衡的训练策略,使模型在收敛到高效使用模式之前发现有效的头配置。在不同复杂度的文本分类任务实验中,我们的方法在 FLOPs 和内存等推理成本方面实现降低,同时也实现了超越标准完整多头注意力的性能。这些结果凸显了自适应头分配作为提升 Transformer 架构效率与有效性的原则方法的潜力。
关键词
引用
@article{arxiv.2604.22583,
title = {Adaptive Head Budgeting for Efficient Multi-Head Attention},
author = {Bilal Faye and Abdoulaye Mbaye and Hanane Azzag and Mustapha Lebbah},
journal= {arXiv preprint arXiv:2604.22583},
year = {2026}
}