DPI:利用参数异构性实现干扰自由的微调
计算与语言
2026-01-27 v1 人工智能
摘要
监督微调 (SFT) 是适应大语言模型 (LLM) 以适应下游任务的关键步骤。然而,来自异构 SFT 任务之间相互冲突的目标往往会引发“倒棋”效应:针对一个任务进行优化可能会损害对其他任务的性能,尤其是在参数被不加区分地更新的情况下。本文提出了一种原则化的方法,将任务特定的参数区域分离和隔离,基于参数异构性是导致跨任务干扰的假设。具体而言,我们首先独立地在多样化的 SFT 任务上进行微调,并识别每个任务的核心参数区域,即 exhibiting 最大更新的参数子集。对于核心参数区域高度重叠的任务进行合并进行联合训练,而对于不相交的任务则组织为不同的阶段。在多阶段 SFT 期间,冻结先前任务中获得的核心参数,从而防止被后续任务覆盖。为验证我们方法的有效性,我们在多个公开数据集上进行了大量实验。结果表明,我们的动态参数隔离策略在数据冲突方面始终具有较小的数据冲突,并相对于多阶段和多任务调谐基线实现了持续的性能提升。
引用
@article{arxiv.2601.17777,
title = {DPI: Exploiting Parameter Heterogeneity for Interference-Free Fine-Tuning},
author = {Xiaoyu Liu and Xiaoyu Guan and Di Liang and Xianjie Wu},
journal= {arXiv preprint arXiv:2601.17777},
year = {2026}
}