Transformer 中局部注意力的可表达性特征
计算与语言
2026-05-20 v2
摘要
Transformer 是语言建模最流行的神经网络架构。其核心是全局注意力机制,使模型在生成下一个 token 之前能够聚合来自所有前导 token 的信息。一种常见的注意力变体称为局部注意力,限制每个 token 只能聚合来自其前导 token 中受限窗口的信息,将全局注意力的二次计算成本降低到线性。虽然这种限制通常以效率为出发点,但也发现其能提高模型质量,而这一现象迄今尚无令人满意的解释。我们以识别器可表达性(recognizer expressivity)为框架,对该现象进行形式化阐述。已证明具有固定精度的全局注意力 Transformer 对应于线性时序逻辑的一个片段,其中仅包含单个过去算子。我们额外证明,加入局部注意力后会引入第二个时序算子,严格扩大了可识别正则语言的类。此外,全局注意力与局部注意力在可表达性上是互补的: neither 包含于另一方面,二者组合可获得最丰富的片段。在形式语言识别与自然语言建模实验中,我们的结果印证了该理论,表明混合全局-局部 Transformer 在性能上优于仅使用全局注意力的模型。
关键词
引用
@article{arxiv.2605.00768,
title = {Characterizing the Expressivity of Local Attention in Transformers},
author = {Jiaoda Li and Ryan Cotterell},
journal= {arXiv preprint arXiv:2605.00768},
year = {2026}
}
备注
ACL 2026