中文

真的被遗忘了?通过影响样本对验证机器遗忘

密码学与安全 2024-06-18 v1

摘要

机器遗忘使得预训练模型能够消除部分训练样本的影响。以往的研究主要集中在提出高效的遗忘策略上。然而,机器遗忘的验证,或者说如何保证一个样本已被成功遗忘,长期以来一直被忽视。现有的验证方案通常依赖于机器学习攻击技术,例如后门攻击或成员推断攻击。由于这些技术并非专门为验证而设计,当不可信的机器学习即服务(MLaaS)为了仅仅满足验证条件而进行快速微调,而非执行真正的遗忘时,它们很容易被绕过。在本文中,我们提出了一种形式化的验证方案 IndirectVerify,用于判断遗忘请求是否已被成功执行。我们设计了影响样本对:一个称为触发样本,另一个称为反应样本。用户发送关于触发样本的遗忘请求,并使用反应样本来验证遗忘操作是否已成功执行。我们提出了一种基于扰动的方案来生成这些影响样本对。其目标是仅扰动一小部分触发样本,从而导致反应样本的重新分类。这种间接影响将用于我们的验证目的。与现有方案在所有过程中使用相同样本不同,我们的方案 IndirectVerify 提供了更强的鲁棒性,使其更不容易被绕过。

关键词

引用

@article{arxiv.2406.10953,
  title  = {Really Unlearned? Verifying Machine Unlearning via Influential Sample Pairs},
  author = {Heng Xu and Tianqing Zhu and Lefeng Zhang and Wanlei Zhou},
  journal= {arXiv preprint arXiv:2406.10953},
  year   = {2024}
}