中文

通过深度感知的遗忘特定方向移除实现类别遗忘

计算机视觉与模式识别 2026-05-20 v2 人工智能 机器学习

摘要

机器遗忘旨在从已训练模型中移除特定知识,而无需从头重新训练的成本。然而,在类别遗忘中,降低对遗忘类别的准确率并不一定意味着真正的遗忘:被遗忘的信息可能仍编码在内部表示中,而表面上的遗忘可能源于分类器头的抑制而非表示层面的移除。我们表明,现有的类别遗忘方法通常表现出弱选择性或负选择性,在深层表示中保留遗忘类别的结构,或严重依赖于最终层的偏置偏移。然后,我们引入了 DAMP(通过投影的深度感知调制),这是一种单次、闭式的权重手术方法,无需基于梯度的优化即可从预训练网络中移除遗忘特定方向。在每个阶段,DAMP 计算下一个可学习算子输入空间中的类别原型,提取相对于保留类别原型的残差作为遗忘方向,并应用基于投影的更新来减少下游对这些方向的敏感性。为了保持效用,DAMP 使用一个从探针可分性导出的无参数深度感知缩放规则,在早期层应用较小的编辑,在深层应用较大的编辑。该方法通过低秩子空间移除自然地扩展到多类别遗忘。在 MNIST、CIFAR-10、CIFAR-100 和 Tiny ImageNet 上,以及跨卷积和 Transformer 架构,DAMP 比某些先前方法更接近重训练黄金标准,改善了选择性遗忘,同时更好地保留了保留类别的性能,并减少了深层中残留的遗忘类别结构。

关键词

引用

@article{arxiv.2604.15166,
  title  = {Class Unlearning via Depth-Aware Removal of Forget-Specific Directions},
  author = {Arman Hatami and Romina Aalishah and Ilya E. Monosov},
  journal= {arXiv preprint arXiv:2604.15166},
  year   = {2026}
}

备注

Accepted for oral presentation at the CVPR 2026 Workshop on Machine Unlearning for Vision (MUV). Code: https://github.com/armanhtm/DAMP