中文

Potion: 迈向毒化遗忘

机器学习 2024-09-12 v3

摘要

恶意行为者对机器学习系统的对抗性攻击,例如在训练数据集中引入毒化触发器,会带来重大风险。在实践中,当只能识别出部分毒化数据时,解决此类攻击的挑战就出现了。这需要开发方法,以便在仅知道部分毒化数据的情况下,从已训练的模型中移除(即遗忘)毒化触发器。此任务的要求与以隐私为中心的遗忘显著不同,在隐私遗忘中,模型需要遗忘的所有数据都是已知的。先前的工作表明,未发现的毒化样本会导致已建立的遗忘方法失败,只有一种方法,即选择性突触抑制,取得了有限的成功。即使在移除已识别的毒化数据后完全重新训练,也无法解决这一挑战,因为未发现的毒化样本会导致毒化触发器重新引入模型。我们的工作解决了两个关键挑战,以推进毒化遗忘领域的最新水平。首先,我们引入了一种基于选择性突触抑制的新型抗异常值方法,该方法显著提高了模型保护和遗忘性能。其次,我们引入了毒化触发器中和搜索,这是一种快速、可并行化的超参数搜索,它利用特征性的“遗忘与模型保护”权衡,在遗忘集大小未知且保留集被污染的情况下找到合适的超参数。我们使用CIFAR10上的ResNet-9和CIFAR100上的WideResNet-28x10对我们的贡献进行基准测试。实验结果表明,我们的方法治愈了93.72%的毒化,而选择性突触抑制为83.41%,完全重新训练为40.68%。同时,我们将由遗忘引起的平均模型准确率下降从5.68%(选择性突触抑制)降低到1.41%(我们的方法)。

关键词

引用

@article{arxiv.2406.09173,
  title  = {Potion: Towards Poison Unlearning},
  author = {Stefan Schoepf and Jack Foster and Alexandra Brintrup},
  journal= {arXiv preprint arXiv:2406.09173},
  year   = {2024}
}

备注

Accepted for publication in the Journal of Data-centric Machine Learning Research (DMLR) https://openreview.net/forum?id=4eSiRnWWaF