通过恢复蒸馏缓解长上下文大语言模型的短文本性能下降:LongReD
计算与语言
2025-05-29 v3 机器学习
摘要
大语言模型(LLM)通过扩展位置编码和轻量持续预训练获得了更长的上下文窗口,但这往往导致在短文本任务上的性能下降,而导致这种下降的原因尚未得到充分探讨。本文我们识别出两种主要因素导致此问题:隐藏状态和注意力得分的分布漂移,以及持续预训练中的灾难性遗忘。为解决这些挑战,我们提出了一种新方法——恢复蒸馏长上下文预训练(LongReD),旨在通过最小化扩展模型与原始模型之间的分布差异来缓解短文本性能下降。除了在长文本上进行训练之外,LongReD还会对选定层的隐藏状态在短文本上进行蒸馏。此外,LongReD还引入了短文本到长文本的蒸馏,通过利用跳过的位置索引,将短文本上的输出分布与长文本上的输出分布对齐。实验在常见文本基准测试上表明,LongReD有效保留了模型的短文本性能,同时保持与基线相当或更好的处理长文本能力。我们的代码已公开:https://github.com/RUCAIBox/LongReD。
引用
@article{arxiv.2502.07365,
title = {LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation},
author = {Zican Dong and Junyi Li and Jinhao Jiang and Mingyu Xu and Wayne Xin Zhao and Bingning Wang and Weipeng Chen},
journal= {arXiv preprint arXiv:2502.07365},
year = {2025}
}
备注
ACL2025 Main