中文

Transformer 的长度外推:基于位置编码视角的综述

计算与语言 2024-10-08 v5

摘要

建立在 Transformer 基础之上的大型语言模型 (LLMs) 因其卓越的能力而受到全球关注。然而,所有基于 Transformer 的模型(包括 LLMs)都受限于预设的长度限制,难以从短训练序列泛化到更长的推理序列,即它们无法执行长度外推以处理长序列,这严重阻碍了其在需要长输入序列(如法律或科学文档)场景中的应用。因此,涌现了许多旨在增强 Transformer 长度外推能力的方法。尽管研究投入巨大,但仍缺乏系统的综述。为了填补这一空白,我们从位置编码 (PE) 的角度,以统一的符号深入探讨了这些进展,因为 PE 被认为是影响长度外推的主要因素。具体而言,我们首先讨论主导该研究领域的可外推 PE。然后,我们深入探讨基于它们的外推方法,涵盖位置插值和随机位置方法。最后,强调了该领域的几个挑战和未来方向。通过本综述,我们旨在使读者深入了解现有方法,并为未来研究提供启发。

关键词

引用

@article{arxiv.2312.17044,
  title  = {Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encoding},
  author = {Liang Zhao and Xiachong Feng and Xiaocheng Feng and Weihong Zhong and Dongliang Xu and Qing Yang and Hongtao Liu and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2312.17044},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 Findings