中文

GQA Transformer 中的灵敏度-位置共定位

计算与语言 2026-04-10 v1 人工智能 机器学习

摘要

我们研究了分组查询注意力(GQA)Transformer 中一个根本性结构问题:任务正确性最敏感的层是否与位置编码适应具有最大影响力的层重合?我们称之为共定位假设,并在 Llama 3.1 8B 上进行测试,该模型为 32 层 GQA 模型,查询-键值头比例为 4:1。我们引入了 \LSLORA,通过一种新颖的正确性差分隐藏状态度量来识别层,限制 LoRA 适应性;以及 GARFA(GQA 感知 RoPE 频率适应),为每个目标层附加 8 个可学习的每 KV 头标量乘子。与共定位假设相反,我们发现存在强烈的反共定位:任务敏感层集中在后期网络({23-31}\ell\in\{23\text{-}31\}),而 RoPE 影响层主导前期网络({0-9}\ell\in\{0\text{-}9\}),导致 Spearman rs=0.735r_s = -0.735p=1.66×106p = 1.66\times10^{-6})。尽管存在这种反共定位,4 向跨层消除实验表明,将两种干预均应用于灵敏度识别的层,可在六个多样化基准测试(MMLU、GPQA、HumanEval+、MATH、MGSM、ARC)中超越所有备选配置,提升 4-16 个百分点。在 $100 总计算成本下,接近 Claude 3.5 Haiku 在 HumanEval+上的表现(67.1% vs. 68.3%)。

关键词

引用

@article{arxiv.2604.07766,
  title  = {Sensitivity-Positional Co-Localization in GQA Transformers},
  author = {Manoj Chandrashekar Rao},
  journal= {arXiv preprint arXiv:2604.07766},
  year   = {2026}
}

备注

8 pages, 5 figures