中文

面向大语言模型的显式多头注意力用于跨注意力头交互

机器学习 2026-01-28 v1 人工智能 计算与语言

摘要

在基于 Transformer 架构构建的大型语言模型中,最近的研究表明,跨注意力头交互可以增强注意力性能。为此,我们提出了多头显式注意力(MEA),这是一种简单而有效的注意力变体,显式地建模跨注意力头的交互。MEA 包含两个关键组件:一个在注意力头之间对 key 和 value 向量分别应用可学习线性组合的头级线性组合(HLC)模块,从而实现丰富的跨注意力头通信;以及一个头级组归一化层,用于对重新组合后的注意力头进行统计属性对齐。MEA 在预训练中表现出强大的鲁棒性,这使得可以使用更大的学习率,从而实现更快的收敛,最终导致更低的验证损失和在各种任务中的 improved 性能。此外,我们探索了 MEA 的参数效率,通过减少注意力头的数量并利用 HLC 使用低秩“虚拟头”来重构它们。这使我们能够实现一种实用的 key-value 缓存压缩策略,将 KV 缓存内存使用减少 50%,在知识密集型和科学推理任务中性能几乎不受影响,在奥林匹克级数学基准测试中仅有 3.59% 的准确率下降。

关键词

引用

@article{arxiv.2601.19611,
  title  = {Explicit Multi-head Attention for Inter-head Interaction in Large Language Models},
  author = {Runyu Peng and Yunhua Zhou and Demin Song and Kai Lv and Bo Wang and Qipeng Guo and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2601.19611},
  year   = {2026}
}