中文

当长上下文有助于短上下文:监督微调中的上下文长度如何影响大型语言模型的行为

计算与语言 2025-10-06 v3 人工智能

摘要

大型语言模型在自然语言处理(NLP)任务中取得了令人瞩目的性能。随着现实世界应用对更长上下文窗口的需求日益增加,在长上下文数据上进行持续预训练和监督微调(SFT)已成为一种常见方法。尽管数据长度在持续预训练中的影响已被广泛研究,但其对 SFT 的影响仍不清楚。在这项工作中,我们系统地研究了 SFT 数据长度如何影响 LLM 在短上下文任务上的行为。与直觉相反,我们发现长上下文 SFT 提升了短上下文性能,这与持续预训练中观察到的长上下文通常导致的性能退化相反。为了揭示这一现象的潜在机制,我们首先解耦并分析了两个关键组件,多头注意力(MHA)和前馈网络(FFN),并表明两者都独立地从长上下文 SFT 中受益。我们进一步研究了它们的交互作用,并揭示了一种知识偏好偏差:长上下文 SFT 促进上下文知识,而短上下文 SFT 偏好参数化知识,使得完全依赖长上下文 SFT 是次优的。最后,我们证明了混合训练可以缓解这种偏差,为微调 LLM 提供了可解释的指导。

关键词

引用

@article{arxiv.2509.18762,
  title  = {When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models},
  author = {Yingming Zheng and Hanqi Li and Kai Yu and Lu Chen},
  journal= {arXiv preprint arXiv:2509.18762},
  year   = {2025}
}