中文

一种基于信息论的机器遗忘方法

机器学习 2024-12-03 v4 人工智能 机器学习

摘要

为遵守人工智能与数据法规,从已训练的机器学习模型中遗忘私有或受版权保护信息的需求日益重要。遗忘的关键挑战在于及时遗忘必要数据,同时保持模型性能。本文针对零样本遗忘场景,即遗忘算法仅凭已训练模型及待遗忘数据即可移除信息。我们从信息论视角探索遗忘,将样本的影响与模型通过观察该样本所获得的信息增益联系起来。由此,我们推导出一种基于模型几何结构的简单但原则性的零样本遗忘方法。我们的方法形式为:在目标遗忘点周围的小邻域内,最小化所学函数的梯度。这会产生平滑效应,通过移动分类器边界来实现遗忘。我们通过一系列低维实验,探讨了该方法为何能联合遗忘目标样本同时保持整体模型性能的直观原因。我们在多个当代基准上对我们的方法进行了广泛的实证评估,验证了在零样本遗忘的严格约束下,我们的方法具有与最先进性能相竞争的能力。项目代码见 https://github.com/jwf40/Information-Theoretic-Unlearning。

关键词

引用

@article{arxiv.2402.01401,
  title  = {An Information Theoretic Approach to Machine Unlearning},
  author = {Jack Foster and Kyle Fogarty and Stefan Schoepf and Zack Dugue and Cengiz Öztireli and Alexandra Brintrup},
  journal= {arXiv preprint arXiv:2402.01401},
  year   = {2024}
}

备注

Updated, new low-dimensional experiments and updated perspective on unlearning from an information theoretic view