LayerNorm 导致 Transformer 解码器出现近时偏置
计算与语言
2026-04-21 v4 机器学习
摘要
因果自注意力为 Transformer 解码器提供位置信息。先前的研究表明,单靠堆叠的因果自注意力层会导致注意力得分偏向较早的 token。然而,这与 Transformer 解码器中通常观察到的偏向后续 token 的偏置(即近时偏置)不同。我们通过分析因果自注意力与其他架构组件的相互作用来解决这一差异。我们展示,堆叠的因果自注意力层结合 LayerNorm 会诱导近时偏置。此外,我们还检查残差连接和输入 token 嵌入分布对该偏置的影响。我们的结果提供了位置信息如何与架构组件相互作用的新的理论见解,并为改进位置编码策略提供了方向。
引用
@article{arxiv.2509.21042,
title = {LayerNorm Induces Recency Bias in Transformer Decoders},
author = {Junu Kim and Xiao Liu and Zhenghao Lin and Lei Ji and Yeyun Gong and Edward Choi},
journal= {arXiv preprint arXiv:2509.21042},
year = {2026}
}
备注
Codes available at: https://github.com/starmpcc/layernorm_recency_bias