中文

NExtLong:面向无长文档的有效长上下文训练框架

化学物理 2025-07-08 v1

摘要

拥有扩展上下文窗口的大语言模型(LLM)取得了显著进展,但由于长文档稀缺,仍面临挑战。现有方法倾向于合成长上下文数据,但缺乏明确机制来强化长程依赖建模。为解决此限制,我们提出NExtLong,一种通过负文档扩展合成长上下文数据的新框架。NExtLong 将文档分解为多个 meta-chunks,通过交错插入来自预训练语料库检索到的硬性负面干扰项来扩展上下文。这种方法迫使模型区分长程依赖的上下文与干扰内容,从而增强其建模长程依赖的能力。大量实验表明,与现有长上下文合成方法和领先模型相比,NExtLong 在 HELMET 和 RULER 基准测试中实现显著性能提升,这些模型是在非合成长文档上训练的。这些发现突显了 NExtLong 减少对非合成长文档依赖的能力,使其成为开发高级长上下文 LLM 的有效框架。

关键词

引用

@article{arxiv.2501.12765,
  title  = {Self-Refinement of Auxiliary-Field Quantum Monte Carlo via Non-Orthogonal Configuration Interaction},
  author = {Zoran Sukurma and Martin Schlipf and Georg Kresse},
  journal= {arXiv preprint arXiv:2501.12765},
  year   = {2025}
}