中文

LaMPE:面向自适应长上下文扩展的长度感知多粒度位置编码(无需训练)

计算机视觉与模式识别 2025-08-05 v1 机器学习

摘要

大型语言模型 (LLM) 在输入超过预训练上下文窗口时会因旋转位置编码 (RoPE) 的超分布 (OOD) 行为而出现显著性能下降。最近的研究通过固定映射策略将 OOD 位置重新映射到分布内范围,忽略输入长度与模型有效上下文窗口之间动态关系。为此,我们提出长度感知多粒度位置编码 (LaMPE),一种无需训练即可充分利用模型有效上下文窗口进行自适应长上下文扩展的方法。基于相对位置的左偏频率分布,LaMPE 通过参数化的 sigmoid 函数建立映射长度与输入长度之间的动态关系,以在不同输入长度下自适应分配位置容量。同时,LaMPE 设计了一种新型多粒度注意力机制,战略性地在不同序列区域分配位置分辨率,以捕获细粒度局部性和长程依赖。该方法可无缝应用于广泛的基于 RoPE 的 LLM,无需训练。在三个代表性 LLM 上通过五个主流长上下文基准测试表明,LaMPE 在现有长度外推方法上显著提升了性能。代码将在 https://github.com/scar-on/LaMPE 发布。

关键词

引用

@article{arxiv.2508.02307,
  title  = {Whole-body Representation Learning For Competing Preclinical Disease Risk Assessment},
  author = {Dmitrii Seletkov and Sophie Starck and Ayhan Can Erdur and Yundi Zhang and Daniel Rueckert and Rickmer Braren},
  journal= {arXiv preprint arXiv:2508.02307},
  year   = {2025}
}