机器遗忘研究综述
机器学习
2024-09-18 v6 人工智能
摘要
当今计算机系统存储大量个人数据。尽管如此丰富的数据促成了人工智能尤其是机器学习(ML)的突破,但其存在可能威胁用户隐私,并削弱人与AI间的信任纽带。近期法规要求,应请求须从计算机系统及ML模型中删除关于用户的私人信息,即“被遗忘权”。虽然从后端数据库删除数据应较直接,但在AI语境中并不充分,因为ML模型常“记住”旧数据。针对训练模型的当代对抗攻击已证明,我们可获知某样本或属性是否属于训练数据。此现象呼唤新范式,即机器遗忘,使ML模型遗忘特定数据。结果表明,由于缺少通用框架与资源,近期机器遗忘研究未能完全解决问题。因此,本文旨在全面考察机器遗忘的概念、场景、方法与应用。具体地,作为前沿研究的分类汇集,本文意在成为寻求机器遗忘及其公式化、设计准则、删除请求、算法与应用介绍的研习者与从业者的综合资源。此外,我们旨在强调关键发现、当前趋势以及尚未应用机器遗忘但可极大受益的新研究领域。我们希望本综述成为ML研究者及隐私技术创新者的宝贵资源。我们的资源公开于 https://github.com/tamlhp/awesome-machine-unlearning。
引用
@article{arxiv.2209.02299,
title = {A Survey of Machine Unlearning},
author = {Thanh Tam Nguyen and Thanh Trung Huynh and Zhao Ren and Phi Le Nguyen and Alan Wee-Chung Liew and Hongzhi Yin and Quoc Viet Hung Nguyen},
journal= {arXiv preprint arXiv:2209.02299},
year = {2024}
}
备注
extend the survey with more recent published work and add more discussions