中文

RePo:基于上下文重新定位的语言模型

机器学习 2026-03-06 v2 人工智能 计算与语言

摘要

原子学习是现代大型语言模型 (Large Language Models, LLMs) 的基本特性;然而,主流架构通过为标记分配线性或恒定位置索引,施加了刚性且固定的上下文结构。借助认知负荷理论 (Cognitive Load Theory, CLT),我们认为这种缺乏信息的结构会增加额外的认知负荷,消耗有限的工作记忆容量,应用于深层推理和注意力分配。为此,我们提出 RePo,一种通过上下文重新定位降低额外负荷的新机制。不同于标准方法,RePo 使用可微模块 fϕf_\phi 分配标记位置,以捕获上下文依赖关系,而非依赖预定义顺序。通过在 OLMo-2 1B 与 7B 模型上持续预训练,我们展示 RePo 在涉及噪声上下文、结构化数据和更长上下文长度的任务上 consistently 增强性能,同时保持对一般短上下文任务的竞争性能。详细分析显示,RePo 成功地为遥远但相关信息分配更高注意力,在稠密且非线性空间中分配位置,并捕获输入上下文的内在结构。我们将开源代码和模型权重。我们的代码位于 https://github.com/SakanaAI/repo。

关键词

引用

@article{arxiv.2512.14391,
  title  = {RePo: Language Models with Context Re-Positioning},
  author = {Huayang Li and Tianyu Zhao and Deng Cai and Richard Sproat},
  journal= {arXiv preprint arXiv:2512.14391},
  year   = {2026}
}

备注

updated with results on 7B model