注意力对齐与灵活位置嵌入改进Transformer的长度外推能力
计算与语言
2023-11-16 v2 机器学习
摘要
一个理想的可长度外推的Transformer语言模型能够处理长于训练长度的序列而无需任何微调。这种长上下文利用能力在很大程度上依赖于灵活的位置嵌入设计。在考察现有大型预训练Transformer语言模型的灵活性后,我们发现T5系列值得更仔细的研究,因为其位置嵌入捕获了丰富而灵活的注意力模式。然而,T5存在注意力分散问题:输入序列越长,注意力分布越平坦。为缓解该问题,我们通过温度缩放提出了两种注意力对齐策略。我们的结果表明,在无需任何微调的情况下,T5在语言建模、检索、多文档问答和代码补全任务上的长上下文利用能力得到提升。这表明灵活的位置嵌入设计与注意力对齐可大幅促进Transformer的长度外推。
引用
@article{arxiv.2311.00684,
title = {Attention Alignment and Flexible Positional Embeddings Improve Transformer Length Extrapolation},
author = {Ta-Chung Chi and Ting-Han Fan and Alexander I. Rudnicky},
journal= {arXiv preprint arXiv:2311.00684},
year = {2023}
}