基于维度-wise位置嵌入操作的有效长度外推
计算与语言
2025-04-29 v1 人工智能
摘要
大型语言模型(LLM)常在输入标记数超过预训练长度时难以处理和生成连贯的上下文。最近的长上下文扩展进展显著扩展了LLM的上下文窗口,但需要昂贵的开销来训练具有更长上下文的大规模模型。在本工作中,我们提出一种维度-wise位置嵌入操作(DPE),这是一种无需训练即可外推LLM上下文窗口的框架,通过深入探索RoPE的不同隐藏维度。我们并不平等地操作所有维度,而是检测每个维度的有效长度并找到上下文扩展的关键维度。我们复用来自预训练模型的原始位置索引及其嵌入,并操作关键维度的位置索引至其最有效的长度。如此一来,DPE在保持最小修改的同时确保每个维度都达到其最优状态,以实现外推。DPE显著超越了YaRN和Self-Extend等众所周知的基线方法。DPE使Llama3-8k 8B能够支持128k标记的上下文窗口,而无需持续训练,并无缝集成到Flash Attention 2中。除了卓越的外推能力之外,DPE还显著提升了模型在训练长度内的性能,例如Llama3.1 70B,在流行的长上下文基准测试RULER上可提升超过18分。与商业模型比较,搭载DPE的Llama 3.1 70B甚至在GPT-4-128K上实现更佳性能。
引用
@article{arxiv.2504.18857,
title = {Effective Length Extrapolation via Dimension-Wise Positional Embeddings Manipulation},
author = {Yi Lu and Wanxu Zhao and Xin Zhou and Chenxin An and Chenglong Wang and Shuo Li and Yuming Yang and Jun Zhao and Tao Ji and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2504.18857},
year = {2025}
}