LLM Unlearning with LLM Beliefs
机器学习
2026-03-16 v2 计算与语言
摘要
大规模语言模型在训练于广泛语料库后,本质上存在记忆敏感或有害内容的风险,这些内容可能在后续输出中重新出现。现有的去学习方法通常依赖梯度上升及其变体来降低特定目标响应的概率。然而,我们发现,这一策略会引发一个关键副作用:概率质量被重新分配到高置信区间,常常对应于目标语义相关表述的重新表述。我们称之为压缩效应,这解释了为何许多方法仅实现虚假的去学习,而这一问题又因自动化指标(如 ROUGE、真实比率)误报实际成功。为此,我们提出了一种引导(bootstrapping)框架,显式地将压缩效应与模型的高置信生成——即其模型信念——关联。由于模型信念本质上捕捉了概率被压缩的高置信区域,将其纳入去学习目标直接反向压缩效应。通过联合抑制目标响应与模型信念,BS-T(token)可削弱高概率 token,而 BS-S(sequence)则移除整个高置信生成,从而实现更彻底的遗忘,同时保持实用性。广泛的在多样化基准上的实验验证了我们方法的有效性。
引用
@article{arxiv.2510.19422,
title = {LLM Unlearning with LLM Beliefs},
author = {Kemou Li and Qizhou Wang and Yue Wang and Fengpeng Li and Jun Liu and Bo Han and Jiantao Zhou},
journal= {arXiv preprint arXiv:2510.19422},
year = {2026}
}
备注
ICLR 2026