面向不精确机器遗忘的对抗性评估
机器学习
2023-02-23 v3 计算机视觉与模式识别
摘要
机器学习模型在存储个人用户数据以及 corrupted 数据(如后门或系统性偏差)的负面影响方面面临越来越多的担忧。机器遗忘(Machine Unlearning)可通过从事先学习好的模型中事后删除受影响的训练数据来解决这些问题。精确实现该任务的计算代价高昂;因此,近期工作提出了不精确遗忘算法以近似地解决此问题,并提出了评估方法来检验这些算法的有效性。在本工作中,我们首先概述了评估方法的一些必要标准,并表明现有评估均无法同时满足所有标准。随后,我们设计了一种更强的黑盒评估方法,称为类间混淆(Interclass Confusion, IC)测试,该方法在训练期间对抗性地操纵数据以检测遗忘过程的不充分性。我们还提出了两种基于解析动机的基线方法(EU-k 和 CF-k),其性能优于若干流行的不精确遗忘方法。总体而言,我们展示了对抗性评估策略如何有助于分析各种遗忘现象,从而指导更强遗忘算法的发展。
引用
@article{arxiv.2201.06640,
title = {Towards Adversarial Evaluations for Inexact Machine Unlearning},
author = {Shashwat Goel and Ameya Prabhu and Amartya Sanyal and Ser-Nam Lim and Philip Torr and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2201.06640},
year = {2023}
}
备注
Tech Report