中文

让 AI 忘记你:机器学习中的数据删除

机器学习 2019-11-06 v2 机器学习

摘要

近期激烈讨论聚焦于如何赋予个人对其数据能否被使用的控制权——欧盟的被遗忘权(Right To Be Forgotten)法规即是此类努力的例证。本文中,我们开启一个研究框架,探讨当不再允许部署源自特定用户数据的模型时该如何应对。具体而言,我们形式化了从训练好的机器学习模型中高效删除个体数据点的问题。对于许多标准 ML 模型,彻底移除个体数据的唯一方法是基于剩余数据从头重训整个模型,而这通常在计算上不切实际。我们研究了使 ML 中数据删除高效的算法原理。针对 k-means 聚类的特定设定,我们提出两种可证明高效的删除算法,在 6 个数据集上实现了删除效率平均超过 100 倍的提升,同时产生与规范 k-means++ 基线统计质量相当的簇。

关键词

引用

@article{arxiv.1907.05012,
  title  = {Making AI Forget You: Data Deletion in Machine Learning},
  author = {Antonio Ginart and Melody Y. Guan and Gregory Valiant and James Zou},
  journal= {arXiv preprint arXiv:1907.05012},
  year   = {2019}
}

备注

To appear in NeurIPS 2019