中文

SoK:模型去记忆的可去性与去记忆

机器学习 2026-05-13 v1 人工智能 密码学与安全

摘要

高级模型去记忆方法,包括可用性投毒(不可去性)与机器去记忆,正成为机器学习(ML)中防止数据滥用关键的防御手段。在训练阶段,不可去性通过嵌入数据中的不可察觉扰动来降低可学习性;在训练后阶段,去记忆从模型中移除先前获取的信息,以防止未授权的披露或使用。尽管两种防御旨在保留"忘却权利",但其脆弱性与共享基础仍不清晰。具体而言,不可去性与去记忆均存在浅层去记忆问题,导致在权重扰动存在下,错误声称数据可学习性降低或忘却。此外,输入扰动可能影响下游去记忆效果,而去记忆可能不慎恢复被不可去性隐藏的领域知识。这种相互作用呼吁深入调查。最终,缺乏形式化保证来提供对当前防御抗浅层去记忆的理论见解。本系统化知识综述提出了首个综合分析,探讨模型去记忆方法中集成化的不可去性与去记忆。我们的贡献有三方面:(i) 不可去性与可扩展去记忆方法的统一分类体系;(ii) 对领先方法的实证评估,揭示其鲁棒性、相互作用与浅层去记忆;(iii) 提出针对经经认证去记忆处理的模型去记忆深度首个理论保证。这些结果为跨ML生命周期统一去记忆机制奠定基础,实现对敏感知识的深层不可记忆状态。

关键词

引用

@article{arxiv.2605.11592,
  title  = {SoK: Unlearnability and Unlearning for Model Dememorization},
  author = {Mengying Zhang and Derui Wang and Ruoxi Sun and Xiaoyu Xia and Shuang Hao and Minhui Xue},
  journal= {arXiv preprint arXiv:2605.11592},
  year   = {2026}
}

备注

The first two authors contributed equally