中文

Resonance RoPE:改进大语言模型的上下文长度泛化能力

计算与语言 2024-09-05 v2 人工智能

摘要

本文解决了配备旋转位置嵌入 (RoPE) 的大语言模型 (LLMs) 中“训练短 - 测试长”(TSTL) 场景的挑战,即在较短序列上预训练的模型难以处理较长序列中的分布外 (OOD) 令牌位置。我们引入了 Resonance RoPE,这是一种新颖的方法,旨在通过优化 OOD 位置的 RoPE 特征插值来缩小 TSTL 场景中的泛化差距,从而在不增加额外在线计算成本的情况下显著提高模型性能。此外,我们提出了 PosGen,这是一个专门为 TSTL 场景中的细粒度行为分析设计的新合成基准,旨在将长上下文中令牌生成难度的持续增加与识别新令牌位置的挑战隔离开来。我们在合成任务上的实验表明,应用 Resonance RoPE 后,Transformers 能更好、更稳健地识别 OOD 位置。我们广泛的 LLM 实验还表明,将 Resonance RoPE 应用于当前最先进的 RoPE 缩放方法 YaRN 后,在上游语言建模任务和各种下游长文本应用中均表现出卓越的性能。

关键词

引用

@article{arxiv.2403.00071,
  title  = {Resonance RoPE: Improving Context Length Generalization of Large Language Models},
  author = {Suyuchen Wang and Ivan Kobyzev and Peng Lu and Mehdi Rezagholizadeh and Bang Liu},
  journal= {arXiv preprint arXiv:2403.00071},
  year   = {2024}
}

备注

13 pages, 4 figures, accepted at ACL 2024 Findings