中文

位置无关的预投影用于Transformer注意力:Q/K/V之前的非线性特征构建与内容跳跃

计算与语言 2026-04-14 v1 机器学习

摘要

我们提出了对Transformer注意力模块的两项互补性修改。首先,在层归一化和Q/K/V投影之间插入一个非线性预投影MLP,在应用任何位置编码之前,以位置无关的方式构建更丰富的特征。其次,一个内容跳跃连接将预投影的特征绕过注意力机制,使得内容信息在有益时能够绕过位置感知的注意力。在Pythia-160M和410M上的冻结探针实验中,组合方法在所有方法中取得了最强结果:在160M规模下,LAMBADA准确率提升+40.6%,困惑度降低-39%。学习到的跳跃连接权重揭示了跨模型大小的一致模式:较后的Transformer层比较早的层更强烈地激活内容绕过,这表明深层受益于不经过位置注意力的内容信息。所有修改均不增加K/V缓存开销。

关键词

引用

@article{arxiv.2604.10791,
  title  = {Position-Agnostic Pre-Projection for Transformer Attention: Nonlinear Feature Construction and Content Skip Before Q/K/V},
  author = {Chirag Shinde},
  journal= {arXiv preprint arXiv:2604.10791},
  year   = {2026}
}

备注

7 pages, 2 figures, 5 tables. Code: https://github.com/cs-cmyk/preprojection