大型语言模型在持续微调过程中灾难性遗忘的机制分析
机器学习
2026-01-27 v1 计算与语言
摘要
大型语言模型通过预训练和微调范式在多种任务中展现出卓越的性能。然而,在序列任务上的持续微调会引发灾难性遗忘,即新获取的知识干扰了先前学习的能力。尽管对这一现象有广泛的观察,但其机制理解仍然有限。在此,我们对基于 Transformer 的 LLM 在序列微调过程中的灾难性遗忘进行了全面的机制分析。通过对多个模型规模(109B 到 400B 总参数)和任务序列的系统实验,我们确定了驱动遗忘的三个主要机制:注意力权重中的梯度干扰、中间层的表征漂移以及损失景观平坦化。我们证明,遗忘严重程度与任务相似度(Pearson r = 0.87)和梯度对齐指标强相关。我们的分析显示,大约 15% 到 23% 的注意力头在微调过程中经历了严重破坏,其中较低层表现出更高的易感性。这些发现为持续学习系统中开发针对性的缓解策略奠定了机制基础。
引用
@article{arxiv.2601.18699,
title = {Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning},
author = {Olaf Yunus Laitinen Imanov},
journal= {arXiv preprint arXiv:2601.18699},
year = {2026}
}
备注
16 pages, 16 figures (6 main + 10 supplementary)