中文

释放函数向量的力量:表征和缓解持续指令微调中的灾难性遗忘

机器学习 2025-04-17 v2 人工智能

摘要

灾难性遗忘(CF)是机器学习中的一个重大挑战,即模型在学习新任务时遗忘先前已学信息。尽管大语言模型(LLM)具备先进能力,但它们在持续学习中仍面临CF的挑战。现有的大多数研究侧重于通过单一训练序列分析遗忘模式,从而忽视了多样化任务对模型行为的复杂影响。我们的研究探索了不同设置下的CF,发现模型遗忘受到特定训练任务和模型本身的共同影响。为此,我们通过考察函数向量(FV)——LLM中函数的紧凑表示——来解释遗忘,为CF的发生提供了模型依赖的指示器。通过理论和实证分析,我们证明LLM中的CF主要源于激活函数中的偏差,而非任务处理函数的覆盖。基于这些见解,我们提出了一种新颖的函数向量引导训练方法,结合正则化技术来稳定FV并缓解遗忘。在四个基准上的实证测试验证了所提训练方法的有效性,证实了我们的CF和模型函数动态理论框架。我们计划在不久的将来公开发布我们的代码。

关键词

引用

@article{arxiv.2502.11019,
  title  = {Unlocking the Power of Function Vectors for Characterizing and Mitigating Catastrophic Forgetting in Continual Instruction Tuning},
  author = {Gangwei Jiang and Caigao Jiang and Zhaoyi Li and Siqiao Xue and Jun Zhou and Linqi Song and Defu Lian and Ying Wei},
  journal= {arXiv preprint arXiv:2502.11019},
  year   = {2025}
}

备注

10pages