中文

注意力对齐与灵活位置嵌入改进Transformer的长度外推能力

计算与语言 2023-11-16 v2 机器学习

摘要

一个理想的可长度外推的Transformer语言模型能够处理长于训练长度的序列而无需任何微调。这种长上下文利用能力在很大程度上依赖于灵活的位置嵌入设计。在考察现有大型预训练Transformer语言模型的灵活性后,我们发现T5系列值得更仔细的研究,因为其位置嵌入捕获了丰富而灵活的注意力模式。然而,T5存在注意力分散问题:输入序列越长,注意力分布越平坦。为缓解该问题,我们通过温度缩放提出了两种注意力对齐策略。我们的结果表明,在无需任何微调的情况下,T5在语言建模、检索、多文档问答和代码补全任务上的长上下文利用能力得到提升。这表明灵活的位置嵌入设计与注意力对齐可大幅促进Transformer的长度外推。

关键词

引用

@article{arxiv.2311.00684,
  title  = {Attention Alignment and Flexible Positional Embeddings Improve Transformer Length Extrapolation},
  author = {Ta-Chung Chi and Ting-Han Fan and Alexander I. Rudnicky},
  journal= {arXiv preprint arXiv:2311.00684},
  year   = {2023}
}