中文

验证稳健型遗忘:通过对未遗忘模型进行残留知识探测

机器学习 2025-04-22 v1 计算机视觉与模式识别

摘要

机器遗忘(MUL)对于隐私保护和内容管控至关重要,但最近的研究揭示了未遗忘模型中仍保留着被遗忘信息的痕迹,这使对手能够恢复被删除的知识。现有的验证方法仅确认遗忘是否执行,无法检测此类残留信息泄露。为此,我们提出了稳健遗忘的概念,确保模型与重新训练的模型 indistinguishable,并抵抗对手恢复。为 empirically 评估遗忘技术是否满足此安全标准,我们提出了遗忘映射攻击(UMA),这是一种事后遗忘验证框架,通过对抗查询主动探测模型中被遗忘的痕迹。在判别和生成任务上的大量实验表明,现有的遗忘技术即使通过现有验证指标仍然脆弱。通过将 UMA 确立为实用的验证工具,本研究为评估和提高机器遗忘安全性设定了新标准。

关键词

引用

@article{arxiv.2504.14798,
  title  = {Verifying Robust Unlearning: Probing Residual Knowledge in Unlearned Models},
  author = {Hao Xuan and Xingyu Li},
  journal= {arXiv preprint arXiv:2504.14798},
  year   = {2025}
}