中文

重拾被遗忘的成员身份:未学习的模型可作为噪声标签器泄露隐私

机器学习 2025-06-25 v1 人工智能 密码学与安全

摘要

机器不可学习(Machine Unlearning, MU)技术促进请求时从训练好的模型中移除特定数据实例的影响。尽管 MU 技术取得了快速的进展,但其漏洞仍在未得到充分探索,潜在通过泄露表面上已遗忘信息而引发隐私泄露。当前有限的 MU 攻击研究需要访问包含隐私数据的原始模型,这违反了 MU 的关键隐私保护目标。为解决这一差距,我们首次创新性地研究了从未学习的模型(ULMs)中记忆被遗忘的类别成员身份,而无需访问原始模型。具体而言,我们实现了一个记忆攻击(Membership Recall Attack, MRA)框架,采用教师-学生知识蒸馏架构,其中 ULMs 充当噪声标签器将知识传递给学生模型。然后,这被转化为带噪声标签的学习(Learning with Noisy Labels, LNL)问题,用于推断遗忘实例的正确标签。在多个真实数据集上对最先进的 MU 方法进行大量实验,结果表明所提出的 MRA 策略在恢复未学习实例的类别成员身份方面具有高度效能。因此,我们的研究和评估为未来研究 MU 漏洞建立了基准。

关键词

引用

@article{arxiv.2506.19486,
  title  = {Recalling The Forgotten Class Memberships: Unlearned Models Can Be Noisy Labelers to Leak Privacy},
  author = {Zhihao Sui and Liang Hu and Jian Cao and Dora D. Liu and Usman Naseem and Zhongyuan Lai and Qi Zhang},
  journal= {arXiv preprint arXiv:2506.19486},
  year   = {2025}
}

备注

IJCAI 2025