不要半听:在持续指令微调中捕获关键部分信息
计算与语言
2025-05-28 v4 人工智能
摘要
对大型语言模型(LLM)进行指令微调可以驱动它们在特定的下游任务中产生与人类目标一致的结果。然而,对 LLM 进行持续指令微调(CIT)的过程可能会带来灾难性遗忘(CF)问题,即先前学习的能力会退化。最近的方法试图通过修改模型或重放数据来缓解 CF 问题,但这可能只记住了指令的表面模式,并在保留任务上感到困惑。在本文中,我们提出了一种基于关键部分信息增益(KPIG)的新型持续指令微调方法。我们的方法计算掩码部分上的信息增益,以动态重放数据并优化训练目标,这使得 LLM 能够捕获与正确响应相关的任务感知信息,并减轻对指令中通用描述的过拟合。此外,我们提出了两个指标,P-score 和 V-score,来衡量 LLM 的泛化能力和指令遵循能力。实验表明,我们的方法在已见任务和保留任务上都取得了优越的性能。
引用
@article{arxiv.2403.10056,
title = {Don't Half-listen: Capturing Key-part Information in Continual Instruction Tuning},
author = {Yongquan He and Wenyuan Zhang and Xuancheng Huang and Peng Zhang and Lingxun Meng and Xiang Zhou and Ke Zeng and Xunliang Cai},
journal= {arXiv preprint arXiv:2403.10056},
year = {2025}
}
备注
20 pages, 6 figures