中文

大语言模型持续微调中灾难性遗忘的实证研究

计算与语言 2025-01-07 v5

摘要

灾难性遗忘(CF)是机器学习中一种现象,指模型在获取新知识以在下游任务中取得满意性能时遗忘先前已学信息。鉴于大语言模型(LLMs)已展现出卓越性能,研究LLMs在持续指令微调过程中是否存在CF颇具意义。本研究从领域知识、推理与阅读理解的角度,实证评估LLMs知识在持续指令微调中的遗忘现象。实验揭示,参数量从1b到7b的LLMs普遍观察到灾难性遗忘。令人惊讶的是,在该模型规模范围内,随着模型规模增大,遗忘严重程度加剧,这可能源于较大LLM初始性能显著更高。对比仅解码器模型BLOOMZ与编码器-解码器模型mT0,BLOOMZ表现出较少遗忘并保留更多知识。有趣的是,我们还观察到LLMs在持续微调过程中能缓解性别偏见等语言偏见。此外,我们的结果表明,通用指令微调有助于缓解LLMs在后续微调中的遗忘现象。

关键词

引用

@article{arxiv.2308.08747,
  title  = {An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning},
  author = {Yun Luo and Zhen Yang and Fandong Meng and Yafu Li and Jie Zhou and Yue Zhang},
  journal= {arXiv preprint arXiv:2308.08747},
  year   = {2025}
}