中文

自蒸馏作为大语言模型的性能恢复机制:对抗压缩与灾难性遗忘

机器学习 2026-04-20 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)取得了显著成功,支撑了多种人工智能应用。然而,它们常因监督微调(SFT)过程中的灾难性遗忘、量化和剪枝等因素而出现性能下降。在这项工作中,我们引入了一个基于自蒸馏微调(SDFT)的性能恢复框架,该框架能有效恢复模型能力。作为这一实际贡献的补充,我们为潜在的恢复机制提供了严谨的理论解释。我们假设,LLM的生成能力从根本上依赖于其隐藏层构建的高维流形。为了研究这一点,我们采用中心核对齐(CKA)来量化学生和教师激活轨迹之间的对齐程度,利用了其对正交变换和缩放的不变性。我们的实验表明,性能恢复与流形对齐之间存在强相关性,证实了自蒸馏能有效地将学生的高维流形与教师所代表的最优结构对齐。这项研究弥合了实际恢复框架与几何表示理论之间的鸿沟,为理解自蒸馏的内部机制提供了新的见解。

关键词

引用

@article{arxiv.2604.15794,
  title  = {Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting},
  author = {Chi Liu and Xin Chen and Xu Zhou and Fangbo Tu and Srinivasan Manoharan},
  journal= {arXiv preprint arXiv:2604.15794},
  year   = {2026}
}

备注

14 pages, 8 figures