中文

排他自注意力

机器学习 2026-03-11 v1 计算与语言

摘要

我们提出排他自注意力(XSA),这是一种对自注意力(SA)的简单修改,可提高Transformer的序列建模性能。其核心思想是约束注意力仅捕获与token自身值向量正交的信息(即排除自位置信息),从而鼓励更好的上下文建模。在标准语言建模任务上评估,XSA在模型规模达到27亿参数时均优于SA,并且随序列长度的增大显示出越来越大的优势。

关键词

引用

@article{arxiv.2603.09078,
  title  = {Exclusive Self Attention},
  author = {Shuangfei Zhai},
  journal= {arXiv preprint arXiv:2603.09078},
  year   = {2026}
}