贝叶斯注意力机制:位置编码与上下文长度外推的概率框架
计算与语言
2026-05-11 v4 机器学习
摘要
基于Transformer的语言模型依赖位置编码(PE)来处理词元顺序并支持上下文长度外推。然而,现有的PE方法缺乏理论清晰度,且依赖有限的评估指标来证实其外推主张。我们提出了贝叶斯注意力机制(BAM),这是一个将位置编码表述为概率模型中先验的理论框架。BAM统一了现有方法(例如NoPE和ALiBi),并启发了一种新的广义高斯位置先验,该先验显著改善了长上下文泛化能力。在实验中,BAM在训练上下文长度下实现了准确的信息检索,在长上下文检索精度上超越了以往最先进的上下文长度泛化方法,同时保持了相当的困惑度并引入了极少的额外参数。
引用
@article{arxiv.2505.22842,
title = {Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation},
author = {Arthur S. Bianchessi and Yasmin C. Aguirre and Rodrigo C. Barros and Lucas S. Kupssinskü},
journal= {arXiv preprint arXiv:2505.22842},
year = {2026}
}
备注
Accepted to ICLR 2026