中文

从机器学习到机器遗忘:在保持预测模型业务价值的前提下遵循 GDPR 的“被遗忘权”

机器学习 2024-12-04 v2

摘要

近期隐私法规(如 GDPR)赋予数据主体“被遗忘权”(Right to Be Forgotten, RTBF),并要求公司履行数据主体的数据删除请求。然而, companies 在遵守 RTBF 法规方面面临巨大挑战,尤其是当被要求从已训练良好的预测模型中擦除特定训练数据时。虽然研究者引入了机器遗忘方法以实现快速数据擦除,但这些方法常常忽略保持模型性能(如准确率),这可能导致财务损失和不符合 RTBF 义务。本工作开发了一套全面的机器学习到遗忘框架,称为基于集成的迭代信息蒸馏方法(Ensemble-based iTerative Information Distillation, ETID),以在保持预测模型业务价值的前提下实现高效的数据擦除。ETID 融入了一种新的集成学习方法,以构建准确的预测模型,以便处理数据擦除请求。ETID 还引入了一种针对所构建的集成模型的创新性蒸馏式遗忘方法,以实现高效且有效的数据擦除。大量实验表明,ETID 在各种最先进的方法方面均表现出色,能够提供高质量的遗忘模型且具有效率。我们还强调了 ETID 作为促进数据和预测服务合法且繁荣市场的重要工具的潜力。

关键词

引用

@article{arxiv.2411.17126,
  title  = {From Machine Learning to Machine Unlearning: Complying with GDPR's Right to be Forgotten while Maintaining Business Value of Predictive Models},
  author = {Yuncong Yang and Xiao Han and Yidong Chai and Reza Ebrahimi and Rouzbeh Behnia and Balaji Padmanabhan},
  journal= {arXiv preprint arXiv:2411.17126},
  year   = {2024}
}