YaRN:大语言模型上下文窗口的高效扩展方法
计算与语言
2026-02-10 v3 人工智能
机器学习
摘要
旋转位置嵌入(RoPE)已被证明能在基于 transformer 的语言模型中有效编码位置信息。然而,这些模型无法泛化到其训练时所用的序列长度之外。我们提出 YaRN(Yet another RoPE extensioN method),一种计算高效的方法来扩展此类模型的上下文窗口,所需 token 数比先前方法少 10 倍、训练步数少 2.5 倍。使用 YaRN,我们展示 LLaMA 模型能有效利用并外推至远长于其原始预训练所允许的上下文长度,同时在上下文窗口扩展上超越先前最优(SOTA)方法。此外,我们证明 YaRN 具备超出微调数据集有限上下文进行外推的能力。代码见 https://github.com/jquesnelle/yarn
引用
@article{arxiv.2309.00071,
title = {YaRN: Efficient Context Window Extension of Large Language Models},
author = {Bowen Peng and Jeffrey Quesnelle and Honglu Fan and Enrico Shippole},
journal= {arXiv preprint arXiv:2309.00071},
year = {2026}
}