如何减轻 LLM 微调中的灾难性遗忘?基于层级的层级正则化与元素级正则化
计算与语言
2025-02-18 v2 人工智能
摘要
大型语言模型(LLMs)表现出强大的通用语言能力。然而,对这些模型进行特定领域任务的微调常常会导致灾难性遗忘,即模型会覆盖或丢失在预训练期间获得的关键知识。这种现象显著限制了 LLMs 的更广泛应用。为了解决这一挑战,我们提出了一种新方法,用于计算在微调期间保持通用知识所必需的模型参数的层级重要性。我们的方法采用双目标优化策略:(1)基于参数层级重要性的正则化损失,约束对关键通用知识参数的更新;(2)交叉熵损失以适应特定领域任务。此外,我们引入层级系数,以account for不同层的贡献差异,动态平衡双目标优化。在针对科学、医学和物理任务使用 GPT-J 和 LLaMA-3进行大量实验表明,我们的方法在减轻灾难性遗忘的同时,提高了模型的适应性。与以前的方法相比,我们的解决方案约快 20 倍,仅需存储量的 10-15%,突出了实际效率。代码将公开发布。
引用
@article{arxiv.2501.13669,
title = {How to Alleviate Catastrophic Forgetting in LLMs Finetuning? Hierarchical Layer-Wise and Element-Wise Regularization},
author = {Shezheng Song and Hao Xu and Jun Ma and Shasha Li and Long Peng and Qian Wan and Xiaodong Liu and Jie Yu},
journal= {arXiv preprint arXiv:2501.13669},
year = {2025}
}
备注
Work in progress