中文

零样本机器遗忘

机器学习 2023-06-01 v3 人工智能

摘要

现代隐私法规赋予公民被产品、服务及公司遗忘的权利。对于机器学习(ML)应用而言,这要求不仅从存储档案中,还要从 ML 模型中删除数据。由于对 ML 应用合规需求的日益增长,机器遗忘正成为一个新兴研究问题。被遗忘权请求以从已训练 ML 模型中移除某特定数据集或类别数据的形式出现。实际考量排除了在丢弃已删除数据后从头重新训练模型。少数现有研究使用全部训练数据、训练数据子集或训练期间存储的某些元数据来更新模型权重以实现遗忘。然而,在许多情况下,与训练过程或训练样本相关的数据可能因遗忘目的而无法访问。因此我们提出疑问:是否可能在零训练样本下实现遗忘?本文引入零样本机器遗忘这一新问题,以应对无原始数据样本可用的极端但实际的场景。随后我们提出两种基于(a)误差最小化-最大化噪声与(b)门控知识迁移的零样本机器遗忘新方案。这些方法在保持模型对保留数据的效用的同时,从模型中移除遗忘数据的信息。零样本方法对模型反演攻击和成员推断攻击提供了良好防护。我们引入新的评价指标——遗忘指数(AIN)以有效衡量遗忘方法的质量。实验在基准视觉数据集上展示了深度学习模型遗忘的 promising 结果。源代码见:https://github.com/ayu987/zero-shot-unlearning

关键词

引用

@article{arxiv.2201.05629,
  title  = {Zero-Shot Machine Unlearning},
  author = {Vikram S Chundawat and Ayush K Tarun and Murari Mandal and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2201.05629},
  year   = {2023}
}

备注

Accepted in IEEE Transactions on Information Forensics and Security (TIFS)