分组差分注意力
机器学习
2025-10-09 v1 人工智能
摘要
自注意力机制虽然是现代Transformer架构的基础,但存在一个关键低效问题:它经常将大量注意力分配给冗余或噪声上下文。差分注意力通过使用减法注意力图来区分信号与噪声,但其所需的头部均衡分配对表示灵活性和可扩展性施加了严格约束。为克服这一问题,我们提出了分组差分注意力(GDA),一种引入信号保持组与噪声控制组之间非均衡头部分配的新方法。GDA通过战略性地将更多头部分配给信号提取、更少头部分配给噪声控制,显著增强了信号聚焦,并通过受控重复(类似于GQA)稳定后者。该设计以最小的计算开销实现了更强的信号保真度。我们进一步将该原则扩展至分组差异化增长,一种可选择性地仅复制信号聚焦头部的可扩展策略,从而确保高效的容量扩展。通过大规模预训练和持续训练实验,我们证明GDA中的适度不平衡比例相较于对称基线在泛化性和稳定性方面均有显著提升。我们的结果共同确立了基于比例感知的头部分配和选择性扩展是设计可扩展、计算高效的Transformer架构的有效且实用的路径。
引用
@article{arxiv.2510.06949,
title = {Grouped Differential Attention},
author = {Junghwan Lim and Sungmin Lee and Dongseok Kim and Wai Ting Cheung and Beomgyu Kim and Taehwan Kim and Haesol Lee and Junhyeok Lee and Dongpin Oh and Eunhwan Park},
journal= {arXiv preprint arXiv:2510.06949},
year = {2025}
}