中文

谱遗忘:无需重新训练的损坏能力后期恢复

机器学习 2026-05-21 v1 人工智能

摘要

为特定任务微调语言模型通常会损害训练数据从未明确威胁的能力。我们研究了这一现象,即称为灾难性遗忘,提出一种后期修复解决方案,仅使用预训练检查点WbaseW_{\mathrm{base}}及其微调后代WftW_{\mathrm{ft}}。目标不仅是将模型恢复到基准检查点,更是恢复因微调损坏的能力,同时保留目标任务的收益以及任何有益的超出改进。我们引入DG-Hard,一种仅使用检查点的谱修复方法,用于微调更新Δ=WftWbase\Delta = W_{\mathrm{ft}} - W_{\mathrm{base}}。DG-Hard将Δ\Delta视为嵌入在随机噪声残差中的低秩任务对齐信号,应用Donoho-Gavish硬奇异值阈值对每个权重- delta矩阵进行处理,保留更新的结构化高能部分并移除谱质心。这将修复简化为一个无需数据依赖调优的闭形式SVD滤波步骤。一个中心难题是评估:平均准确率掩盖了每个基准的失败,而朴素的恢复得分奖励模型仅仅是回归到基准。因此,我们引入了一个分区条件指标,分别跟踪疗愈、保留、非损坏和目标任务保持。跨1414个(模型、任务)设置和九个跨域超出基准,DG-Hard在后期基准中实现了最强的平衡修复。DG-Hard也在三个独立的安全轴上恢复了因良性微调损失的对齐安全性,尽管未使用任何对齐数据。这些结果表明,微调导致的能力损失的部分并非专业化的不可避免结果,而是权重更新本身中可去除的谱残留。

关键词

引用

@article{arxiv.2605.20296,
  title  = {Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining},
  author = {Aarash Abro and Muhammad Tahir},
  journal= {arXiv preprint arXiv:2605.20296},
  year   = {2026}
}