从分布视角扩展大型语言模型的上下文窗口
计算与语言
2024-10-04 v2
摘要
对旋转位置嵌入(RoPE)进行比例放大已成为扩展 RoPE 基大型语言模型(LLMs)上下文窗口的常用方法。然而,现有的比例放大方法常依赖经验性方法,缺乏对 RoPE 内部分布的深入理解,导致在扩展上下文窗口长度时性能次优。在本文中,我们从旋转角分布的视角对上下文窗口扩展任务进行优化。具体地,我们首先估计模型中旋转角的分布,并分析长度扩展对该分布的扰动程度。随后,我们提出一种新颖的扩展策略,通过最小化旋转角分布之间的扰动来保持与预训练阶段的一致性,从而增强模型对更长序列的泛化能力。实验结果表明,与强基准方法相比,我们的方法在将 LLaMA2 的上下文窗口扩展至 8k 时,分布扰动降低了最高可达72%;扩展至 16k 时,降低了最高可达32%。在 LongBench-E 测试集上,我们的方法相较于现有最先进方法实现了最高可达4.33%的平均提升。此外,我们的方法在上下文窗口扩展后保持模型在 Hugging Face Open LLM 测试集上的性能,仅出现 -0.12 至 +0.22 的平均性能波动。
引用
@article{arxiv.2410.01490,
title = {Extending Context Window of Large Language Models from a Distributional Perspective},
author = {Yingsheng Wu and Yuxuan Gu and Xiaocheng Feng and Weihong Zhong and Dongliang Xu and Qing Yang and Hongtao Liu and Bing Qin},
journal= {arXiv preprint arXiv:2410.01490},
year = {2024}
}
备注
14 pages, 8 figures, Accepted to EMNLP2024