用于长度外推的上下文感知偏置
计算与语言
2025-09-23 v3
摘要
Transformer 通常难以泛化至比训练时所见更长的序列,这一局限性被称为长度外推。大多数现有的相对位置编码(RPE)方法试图通过引入固定线性偏置或全局学习偏置来解决此问题,但它们缺乏适应不同输入上下文的能力。在本工作中,我们提出了一种加性 RPE,即用于长度外推的上下文感知偏置(CABLE),该方法为 Transformer 中的每个注意力头学习特定于词元的上下文感知偏置。通过基于输入序列动态调整位置偏置,CABLE 克服了固定 RPE 的僵化性。在比原始训练长度更长的序列上进行评估时,带有 CABLE 的 GPT-2 Medium(334M 参数)比使用其他广泛采用的位置编码方法的对应模型获得了更低的困惑度。此外,通过将 CABLE 应用于 BERT base 模型,我们提升了长上下文检索任务的性能。我们的方法显著增强了在 FineWeb-Edu-10B 和 WikiText-103 数据集上测试的现有 RPE 方法的外推性能。我们的代码可在以下网址获取:https://github.com/AlgonetLabs/Cable。
引用
@article{arxiv.2503.08067,
title = {Context-aware Biases for Length Extrapolation},
author = {Ali Veisi and Hamidreza Amirzadeh and Amir Mansourian},
journal= {arXiv preprint arXiv:2503.08067},
year = {2025}
}
备注
Accepted at EMNLP 2025 Main Conference