中文

CATNIP:基于校准化和标记化负向偏好对齐的大语言模型无记忆技术

计算与语言 2026-02-04 v1

摘要

预训练的大语言模型中存储的知识引发了关于安全性和隐私的重大关切,这促使大语言模型无记忆技术应运而出,以选择性地移除不良知识的影响。现有方法基于梯度上升法,往往会损害通用领域知识,同时依赖保留数据或精心挑选的对抗性配对,这些数据要么在实际操作中不可行,要么在数据和计算资源上代价高昂。负向偏好对齐技术已被用于无记忆以解决梯度上升法的局限性,但其仍受限于参考模型的选择,在现实数据环境下表现受挫。这些局限性引出两个关键问题:i)我们能否实现一种有效的无记忆方法,通过量化模型对不良知识的置信度,并据此更精确地校准梯度更新,从而减少灾难性遗忘?ii)我们能否使无记忆技术对数据稀缺和长度变化更具鲁棒性?我们通过CATNIP(Calibrated and Tokenized Negative Preference Alignment,即校准化和标记化负向偏好对齐),一种原则性的方法,对模型在标记层面的置信度进行比例缩放,从而实现对遗忘的细粒度控制。对MUSE和WMDP基准的广泛评估表明,我们的方法无需保留数据或对抗性无记忆响应对,即可实现有效的无记忆,且在知识遗忘与保留之间的权衡上优于最先进的方法。

关键词

引用

@article{arxiv.2602.02824,
  title  = {CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment},
  author = {Zhengbang Yang and Yisheng Zhong and Junyuan Hong and Zhuangdi Zhu},
  journal= {arXiv preprint arXiv:2602.02824},
  year   = {2026}
}