OPSDL:面向长上下文语言模型的单策略自蒸馏
计算与语言
2026-04-21 v1 人工智能
摘要
扩大大语言模型(LLM)有效上下文长度是实际应用中的核心挑战。虽然最近的后训练方法在长上下文扩展方面取得了进展,但它们要么依赖高质量的监督数据,要么依赖稀疏的序列级奖励,导致优化不稳定且效率低下。我们提出了OPSDL(On-Policy Self-Distillation),一种用于增强LLM长上下文能力的方法。与其他近期自蒸馏方法不同,OPSDL利用模型自身固有的强短上下文能力作为自我教师,以监督其在长上下文场景中的生成。该模型首先在完整的长上下文条件下生成响应,然后,自我教师通过点态KL散度在相关提取的短上下文下提供逐词监督信号。这种稠密的词级信号鼓励忠实地使用相关证据,减轻因无关上下文引起的幻觉。我们在上下文长度为7B至32B参数的多种模型上评估了OPSDL。结果显示,在不同上下文长度下均实现了一致且显著的改进,凭借更高的样本效率,超越了SFT和DPO等标准后训练方法。值得注意的是,这些收益是在不损害通用短上下文性能的前提下实现的。这些发现凸显了OPSDL作为一种可扩展且稳定的长上下文学习方法的有效性。
引用
@article{arxiv.2604.17535,
title = {OPSDL: On-Policy Self-Distillation for Long-Context Language Models},
author = {Xinsen Zhang and Zhenkai Ding and Tianjun Pan and Run Yang and Chun Kang and Xue Xiong and Jingnan Gu},
journal= {arXiv preprint arXiv:2604.17535},
year = {2026}
}
备注
9 pages, 1 figure