中文

PolicyLong:面向策略性上下文扩展的框架

机器学习 2026-04-10 v1 人工智能

摘要

扩展LLM上下文窗口受限于稀缺的高质量长上下文数据。最近的方法通过信息论验证合成数据,选择能降低基础模型预测熵的上下文。然而,其单次离线构建且以固定模型为基础,存在根本性的离策略差距:静态筛选景观与模型不断演化的能力不匹配,导致训练分布漂移。我们提出PolicyLong,将数据构建转向动态的策略性范式。通过迭代地使用当前模型重新执行数据筛选(熵计算、检索和验证),PolicyLong确保训练分布跟踪不断演化的能力,产生一种自我课程。关键在于,正样本和硬负样本上下文均来自当前模型的熵景观,协同演化模型所学习的内容与所抵抗的内容。在RULER、HELMET和LongBench-v2(Qwen2.5-3B)上的实验表明,PolicyLong consistently优于EntropyLong和NExtLong,在更长的上下文(例如在RULER上128K时提升+2.54)上优势更为显著,确认了策略性数据演进的价值。

关键词

引用

@article{arxiv.2604.07809,
  title  = {PolicyLong: Towards On-Policy Context Extension},
  author = {Junlong Jia and Ziyang Chen and Xing Wu and Chaochen Gao and TingHao Yu and Feng Zhang and Songlin Hu},
  journal= {arXiv preprint arXiv:2604.07809},
  year   = {2026}
}

备注

Work in progress. Correspondence to [email protected] or [email protected]