中文

从休眠到删除:基于权重空间正则化的抗篡改遗忘

机器学习 2026-01-16 v2 人工智能 计算机视觉与模式识别

摘要

近期针对 LLM 的遗忘方法容易受到重学习攻击:被认为已遗忘的知识,在少量(甚至看似无关的)样本上进行微调后会重新出现。我们在视觉分类器的样本级遗忘受控设置中研究了这一现象。我们令人惊讶地发现,仅微调保留集(即零遗忘集样本),遗忘集准确率就能从遗忘后的约 50% 恢复到近 100%。我们在多种遗忘方法中均观察到这一效应,而对于从头重训练并排除遗忘集的模型(黄金标准),其准确率保持在 50%。我们观察到,对重学习攻击的抵抗力可以通过权重空间属性来预测,具体而言,即原始模型与遗忘模型之间的 L2L_2 距离和线性模式连通性。利用这一洞察,我们提出了一类新方法,实现了对重学习攻击的最先进抵抗力。

关键词

引用

@article{arxiv.2505.22310,
  title  = {From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization},
  author = {Shoaib Ahmed Siddiqui and Adrian Weller and David Krueger and Gintare Karolina Dziugaite and Michael Curtis Mozer and Eleni Triantafillou},
  journal= {arXiv preprint arXiv:2505.22310},
  year   = {2026}
}