中文

机器遗忘未能移除数据投毒攻击

机器学习 2026-01-16 v3 人工智能 密码学与安全 计算机与社会

摘要

我们重新审视了为大规模深度学习开发的几种近似机器遗忘实用方法的有效性。除了遵守数据删除请求外,遗忘方法一个常被引用的潜在应用是移除中毒数据的影响。我们通过实验证明,尽管现有遗忘方法已被证明在许多设置中有效,但它们未能移除各种类型投毒攻击(无差别攻击、定向攻击和新引入的高斯投毒攻击)和模型(图像分类器和 LLM)的数据投毒影响;即使被授予相对较大的计算预算。为了精确刻画遗忘效果,我们引入了基于数据投毒的遗忘新评估指标。我们的结果表明,需要更广泛的视角,包括更多样化的评估,以避免对没有可证明保证的深度学习机器遗忘程序产生虚假信心。此外,尽管遗忘方法显示出一些无需重新训练即可有效移除中毒数据的迹象,但我们的工作表明,这些方法尚未“准备就绪”,目前相对于重新训练提供的益处有限。

关键词

引用

@article{arxiv.2406.17216,
  title  = {Machine Unlearning Fails to Remove Data Poisoning Attacks},
  author = {Martin Pawelczyk and Jimmy Z. Di and Yiwei Lu and Gautam Kamath and Ayush Sekhari and Seth Neel},
  journal= {arXiv preprint arXiv:2406.17216},
  year   = {2026}
}

备注

Published at ICLR 2025, Made author ordering consistent with ICLR'25 submission