中文

机器遗忘的盲点:过度遗忘与原型重学习攻击

机器学习 2026-02-02 v3 人工智能

摘要

机器遗忘旨在无需高昂的重新训练成本即可从已训练模型中消除指定的遗忘集,然而现有技术忽略了两个关键盲点:损害遗忘集附近保留数据的“过度遗忘”,以及旨在恢复被遗忘知识的事后“重学习”攻击。针对类别级遗忘,我们首先推导出过度遗忘指标 OU@ϵ\epsilon,用于量化遗忘集邻近区域(即过度遗忘主要出现的区域)的附带损害。接着,我们揭示了机器遗忘中一种不可预见的重学习威胁,即原型重学习攻击,该攻击仅利用少量样本即可提取遗忘类别的每类原型,并轻易恢复遗忘前的性能。为了应对类别级遗忘中的这两个盲点,我们引入了 Spotter,一个即插即用的目标函数,它结合了 针对遗忘类别邻近区域的掩码知识蒸馏惩罚以抑制 OU@ϵ\epsilon,以及 分散遗忘类别嵌入的类内散度损失,从而中和原型重学习攻击。Spotter 在 CIFAR、TinyImageNet 和 CASIA-WebFace 数据集上取得了最先进的结果,为机器遗忘的盲点提供了实用的补救方案。

关键词

引用

@article{arxiv.2506.01318,
  title  = {Unlearning's Blind Spots: Over-Unlearning and Prototypical Relearning Attack},
  author = {SeungBum Ha and Saerom Park and Sung Whan Yoon},
  journal= {arXiv preprint arXiv:2506.01318},
  year   = {2026}
}

备注

9 pages, 5 figures, 3 tables