如何保护模型免受对抗性遗忘攻击?
机器学习
2025-07-16 v1 人工智能
摘要
AI 模型需要被遗忘以满足 AI 法案或 GDPR 等法律要求,同时也因为需要删除有毒内容、消除偏见、消除恶意实例的影响,或数据分布结构变化导致模型工作环境改变。不幸的是,删除知识可能导致不良副作用,例如模型性能恶化。本文研究了对抗性遗忘问题,即恶意方刻意发送遗忘请求以最大化损害模型性能。我们展示,这一现象和对手的能力依赖于许多因素,主要取决于主干模型本身以及选择待遗忘数据的策略/限制。本文的主要结果是一种新方法,用于抵御这些副作用,无论是来自自然过程还是对手行为的遗忘行为。
引用
@article{arxiv.2507.10886,
title = {How to Protect Models against Adversarial Unlearning?},
author = {Patryk Jasiorski and Marek Klonowski and Michał Woźniak},
journal= {arXiv preprint arXiv:2507.10886},
year = {2025}
}