微调期间虚假相关性的无监督识别与移除
机器学习
2026-05-28 v1 机器学习
摘要
在精心策划的数据集上微调预训练语言模型可能会在微调任务与意外的潜在因素(例如,错位的人格或政治倾向)之间产生虚假相关性,而这些潜在因素是由策划过程与任务纠缠在一起的。模型可能会抓住这些虚假相关性,导致偏差和分布外泛化能力下降。我们证明,在关于任务复杂性和虚假相关性的合理假设下,可以从朴素 LoRA 微调的权重中无监督地识别出此类潜在因素。现有的消除偏差的方法,如激活引导,在推理或训练期间从残差流激活中移除已识别的因素。然而,我们认为,目标应该是移除虚假相关性,而不是潜在因素本身,因为预训练模型可能依赖该因素来获取真正的任务信号。为了实现这一点,我们提出了 GRASP(关联虚假模式的梯度投影),该方法阻止模型获得对已识别潜在因素的新的依赖,同时保留沿该方向的任何预训练内容。我们在三个微调任务上进行了验证。前两个涉及紧急错位,即在狭窄任务(在我们的案例中,编写不安全的代码和给出糟糕的医疗建议)上进行微调会导致在无关话题上产生错位响应。在这里,我们的方法在不安全代码案例中完全消除了错位,在糟糕医疗建议案例中将其减少了约 5 倍,在错位减少与任务保持之间的权衡中击败了所有基线。最后一个是新颖的政治偏见实验,在右倾的 Reddit 财务建议数据上进行微调会导致在无关话题上产生政治倾向漂移。在这里,我们的方法将漂移减少了超过一半,同时提高了财务任务性能,击败了所有基线。
引用
@article{arxiv.2605.27676,
title = {Unsupervised Identification and Removal of Spurious Correlations During Fine-Tuning},
author = {Ciarán M. Gilligan-Lee and Joseph Egan and Yuchen Zhu and Michael O'Riordan},
journal= {arXiv preprint arXiv:2605.27676},
year = {2026}
}
备注
10 + 4 pages, comments welcome