中文

Mesa-Extrapolación:提升LLM外推性能的编织位置编码方法

机器学习 2024-10-25 v3 人工智能

摘要

大型语言模型(LLM)虽然在许多领域取得了突破性进展,但仍然面临外推问题,即当输入长度超出训练的最大长度时,推理能力会急剧下降。本文进行了理论分析,以更好地理解为什么在有效范围之外No位置编码(NoPE)会失败,以及位置编码(PE)在这一背景下的作用。我们的发现表明,经过细致的编织位置处理,PE确实可以被扩展到有效范围之外。我们的定理表明,配备编织PE的LLM可以在不增加额外成本的情况下实现 improved 的外推性能。此外,我们引入了一种新颖的编织PE方法,Mesa-Extrapolación,该方法利用基于块的三角形注意力矩阵,并应用于 Stair PE 以管理最后一个块。该方法不仅保持了竞争性能,还提供了显著的优势,如显著降低的内存需求和更快的推理速度。广泛的实验验证了Mesa-Extrapolación的有效性,证明了其作为提升LLM应用范围的可扩展解决方案的潜力。我们的代码已公开于\url{https://github.com/soacker/Mesa-Extrapolation}。

关键词

引用

@article{arxiv.2410.15859,
  title  = {Mesa-Extrapolation: A Weave Position Encoding Method for Enhanced Extrapolation in LLMs},
  author = {Xin Ma and Yang Liu and Jingjing Liu and Xiaoxu Ma},
  journal= {arXiv preprint arXiv:2410.15859},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024; 13 pages and 30 pages appendix;