中文

数据复制:机器遗忘中一种新颖的多用途攻击范式

密码学与安全 2025-07-17 v2 人工智能

摘要

数据复制是数据集中普遍存在的问题。已有研究表明,训练数据集中重复数据的存在会显著影响模型性能与数据隐私。然而,数据复制对遗忘过程的影响在很大程度上尚未得到探索。本文通过率先对数据复制在标准机器遗忘以及联邦遗忘与强化遗忘范式中的作用进行全面研究,填补了这一空白。具体而言,我们提出了一种攻击者:该攻击者复制目标模型训练集的一个子集,并将其纳入训练集。在训练完成后,攻击者要求模型所有者遗忘该复制子集,并分析其对被遗忘模型的影响。例如,攻击者可以通过揭示以下事实来挑战模型所有者:尽管已尽力遗忘,但该复制子集的影响仍残留在模型中。此外,为规避去重技术的检测,我们针对每种特定的遗忘范式,提出了三种新颖的近似复制方法。随后,我们考察了在应用去重技术时,这些方法对遗忘过程的影响。我们的研究揭示了几项关键洞见:1)作为黄金标准的从头重训练遗忘方法在某些条件下无法有效执行遗忘;2)在特定场景下,遗忘重复数据会导致模型性能显著下降;3)经过精心构造的重复数据能够逃避去重方法的检测。

关键词

引用

@article{arxiv.2501.16663,
  title  = {Data Duplication: A Novel Multi-Purpose Attack Paradigm in Machine Unlearning},
  author = {Dayong Ye and Tianqing Zhu and Jiayang Li and Kun Gao and Bo Liu and Leo Yu Zhang and Wanlei Zhou and Yang Zhang},
  journal= {arXiv preprint arXiv:2501.16663},
  year   = {2025}
}

备注

Accepted at USENIX Security 2025