中文

机器不可知的表示遗忘:基于擦除核心的表示遗忘方法

机器学习 2026-03-02 v2 计算机视觉与模式识别

摘要

许多近似机器不可知方法在逻辑层面的遗忘效果显著——例如,对待遗忘集合几乎为零的准确率——但仍保留着内部特征表示中的大量信息。我们称这种差异为表面遗忘。近期研究表明,大多数现有不可知方法主要仅修改最终分类器,使中间表示基本保持不变且与原始模型高度相似。为此,本文引入 Erase at the Core(EC),一种旨在整个网络层级中强制遗忘的框架。EC 将forget 集合上的多层对比遗忘与retain 集合的保持相结合,通过深度监督学习实现。具体而言,EC 为中间层附加辅助模块,在每个监督点分别应用对比遗忘和交叉熵损失,并采用层级加权损失。实验结果表明,EC 不仅实现了有效的逻辑层面遗忘,还在中间层显著降低了与原始模型的表示相似度。此外,EC 是模型无关的,可作为集成到现有不可知方法中的插件模块,提高了表示层面的遗忘效果,同时保持retain 集合上的性能。

关键词

引用

@article{arxiv.2602.05375,
  title  = {Erase at the Core: Representation Unlearning for Machine Unlearning},
  author = {Jaewon Lee and Yongwoo Kim and Donghyun Kim},
  journal= {arXiv preprint arXiv:2602.05375},
  year   = {2026}
}