相对位置的函数式插值提升长上下文 Transformer 性能
机器学习
2024-03-05 v2
摘要
防止 Transformer 在长于训练所用长度的输入上性能衰减,是扩展这些模型上下文长度的重要挑战。尽管 Transformer 架构在本质上对可处理的输入序列长度没有限制,但训练期间所使用的位置编码的选择会限制这些模型在更长输入上的性能。我们提出一种具有渐进插值的新型函数式相对位置编码 FIRE,以改善 Transformer 对更长上下文的泛化能力。我们从理论上证明,该方法可以表示一些流行的相对位置编码,例如 T5 的 RPE、Alibi 和 Kerple。接下来我们通过实验表明,在零样本语言建模和长文本基准上,FIRE 模型对更长上下文具有更好的泛化能力。
引用
@article{arxiv.2310.04418,
title = {Functional Interpolation for Relative Positions Improves Long Context Transformers},
author = {Shanda Li and Chong You and Guru Guruganesh and Joshua Ainslie and Santiago Ontanon and Manzil Zaheer and Sumit Sanghai and Yiming Yang and Sanjiv Kumar and Srinadh Bhojanapalli},
journal= {arXiv preprint arXiv:2310.04418},
year = {2024}
}
备注
26 pages; ICLR 2024 camera ready version