LaMPE:面向自适应长上下文扩展的长度感知多粒度位置编码(免训练)
计算与语言
2025-08-06 v2
摘要
当输入超出预训练上下文窗口时,大型语言模型(LLM)会出现显著的性能下降,这主要归因于旋转位置嵌入(RoPE)的分布外(OOD)行为。近期研究通过使用固定映射策略将 OOD 位置重映射回分布内范围来缓解此问题,但忽略了输入长度与模型有效上下文窗口之间的动态关系。为此,我们提出长度感知多粒度位置编码(LaMPE),这是一种免训练方法,可充分利用模型的有效上下文窗口,在 LLM 中进行自适应长上下文扩展。受相对位置左偏频率分布的启发,LaMPE 通过参数化缩放 Sigmoid 函数建立映射长度与输入长度之间的动态关系,以在不同输入长度下自适应地分配位置容量。同时,LaMPE 设计了一种新颖的多粒度注意力机制,在不同序列区域间策略性地分配位置分辨率,以同时捕获细粒度的局部性与长程依赖。该方法无需训练即可无缝应用于广泛的基于 RoPE 的 LLM。在三个代表性 LLM 和五个主流长上下文基准上的大量实验表明,与现有的长度外推方法相比,LaMPE 实现了显著的性能提升。代码将发布于 https://github.com/scar-on/LaMPE。
引用
@article{arxiv.2508.02308,
title = {LaMPE: Length-aware Multi-grained Positional Encoding for Adaptive Long-context Scaling Without Training},
author = {Sikui Zhang and Guangze Gao and Ziyun Gan and Chunfeng Yuan and Zefeng Lin and Houwen Peng and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2508.02308},
year = {2025}
}
备注
13 pages, 9 figures