中文

SHRED:基于自蒸馏的无保留集忘记方法

机器学习 2026-05-11 v1 人工智能

摘要

大语言模型(LLM)的人类学习旨在选择性地删除记忆内容,如私人数据、版权文本或有害知识,而无需进行高成本的完整重新训练。大多数现有方法需要一个精选的保留集示例来防止通用模型实用性的灾难性退化,增加了部署复杂性。我们提出了SHRED(Self-distillation via High-surprisal-only Retain-set-free Entropy Demotion),一种无保留集的人类学习方法,基于一个关键洞察:记忆信息不均匀分布在忘记集合实例的各个 token 中。高信息 token 集中了模型的记忆知识,而低信息 token 反映了通用的语言能力。SHRED 在两个阶段运行。(1)选择阶段:对忘记集合实例进行前向传播,收集每个 token 的自回归概率,并选择概率最低的 token(即香农信息最高的)作为忘记位置;其余位置保留为良性锚点。(2)训练阶段:构建修改后的 KL 目标,在忘记位置对记忆 token 的 logit 进行降权,同时保持良性位置的原始分布。随后通过单一的 top KL 自蒸馏目标训练模型,以同时实现忘记和实用性保留。我们在四个标准人类学习基准测试中对SHRED进行评估,证明其在忘记效果与模型实用性之间建立了新的 Pareto 最优权衡,超越了依赖保留集的方法。我们的分析表明,SHRED 对抗 relearning 攻击和成员推断攻击具有鲁棒性,并且即使在多次顺序人类学习后也能保持稳定的实用性。

关键词

引用

@article{arxiv.2605.07482,
  title  = {SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion},
  author = {Zizhao Hu and Ameya Godbole and Johnny Tian-Zheng Wei and Mohammad Rostami and Jesse Thomason and Robin Jia},
  journal= {arXiv preprint arXiv:2605.07482},
  year   = {2026}
}