中文

如何保护模型免受对抗性遗忘攻击?

机器学习 2025-07-16 v1 人工智能

摘要

AI 模型需要被遗忘以满足 AI 法案或 GDPR 等法律要求,同时也因为需要删除有毒内容、消除偏见、消除恶意实例的影响,或数据分布结构变化导致模型工作环境改变。不幸的是,删除知识可能导致不良副作用,例如模型性能恶化。本文研究了对抗性遗忘问题,即恶意方刻意发送遗忘请求以最大化损害模型性能。我们展示,这一现象和对手的能力依赖于许多因素,主要取决于主干模型本身以及选择待遗忘数据的策略/限制。本文的主要结果是一种新方法,用于抵御这些副作用,无论是来自自然过程还是对手行为的遗忘行为。

关键词

引用

@article{arxiv.2507.10886,
  title  = {How to Protect Models against Adversarial Unlearning?},
  author = {Patryk Jasiorski and Marek Klonowski and Michał Woźniak},
  journal= {arXiv preprint arXiv:2507.10886},
  year   = {2025}
}