中文

EndPrompt:基于终端锚定的高效长上下文扩展

计算与语言 2026-05-15 v1

摘要

扩展大语言模型的上下文窗口通常需要在目标长度序列上进行训练,这会产生二次方的内存和计算开销,使得长上下文适配成本高昂且难以复现。我们提出了 EndPrompt,一种仅使用短训练序列即可实现有效上下文扩展的方法。其核心洞察在于,让模型暴露于长距离相对位置距离无需构建全长输入:我们将原始短上下文作为完整的第一段保留,并附加一个简短的终端提示作为第二段,为其分配接近目标上下文长度的位置索引。这种两段式构建在短物理序列内同时引入了局部和长距离相对距离,同时保持了训练文本的语义连续性——这是基于分块的模拟方法(分割连续上下文)所缺乏的特性。我们提供了基于旋转位置嵌入和 Bernstein 不等式的理论分析,表明位置插值对注意力函数施加了严格的平滑性约束,而共享的 Transformer 参数进一步抑制了对未观测中间距离的不稳定外推。在 LLaMA 系列模型上将上下文窗口从 8K 扩展到 64K 的应用中,EndPrompt 实现了 76.03 的平均 RULER 分数,并在 LongBench 上取得最高平均值,超越了 LCEG (72.24)、LongLoRA (72.95) 和全长微调 (69.23),同时所需的计算量大幅减少。这些结果表明,长上下文泛化可以从稀疏位置监督中诱导产生,挑战了密集长序列训练是实现可靠上下文窗口扩展所必需的普遍假设。代码可在 https://github.com/clx1415926/EndPrompt 获取。

关键词

引用

@article{arxiv.2605.14589,
  title  = {EndPrompt: Efficient Long-Context Extension via Terminal Anchoring},
  author = {Han Tian and Luxuan Chen and Xinran Chen and Rui Kong and Fang Wang and Jiamin Chen and Jinman Zhao and Yuchen Li and Jiashu Zhao and Shuaiqiang Wang and Haoyi Xiong and Dawei Yin},
  journal= {arXiv preprint arXiv:2605.14589},
  year   = {2026}
}