中文

机器遗忘

密码学与安全 2020-12-16 v3 人工智能 机器学习

摘要

一旦用户将其数据分享到线上,他们通常很难撤销访问权限并要求删除数据。机器学习(ML)加剧了这一问题,因为任何使用该数据训练的模型都可能已将其记忆,使用户面临成功的隐私攻击泄露其信息的风险。然而,让模型遗忘是出了名的困难。我们提出 SISA 训练,这是一个通过策略性地限制数据点在训练过程中的影响来加速遗忘过程的框架。虽然我们的框架适用于任何学习算法,但它旨在为随机梯度下降等深度神经网络的有状态算法带来最大的改进。SISA 训练降低了与遗忘相关的计算开销,即使在遗忘请求在训练集上均匀发出的最坏情况下也是如此。在某些情况下,服务提供商可能先验地知道用户将发出的遗忘请求的分布。我们可以将此先验考虑在内,相应地划分和排序数据,并进一步降低遗忘带来的开销。我们的评估涵盖了来自不同领域的多个数据集,并给出了相应的遗忘动机。在无分布假设下,对于简单学习任务,我们观察到 SISA 训练将 Purchase 数据集上遗忘点的时间较从头重训练提升了 4.63 倍,SVHN 数据集上提升了 2.45 倍。SISA 训练在 ImageNet 分类等复杂学习任务的重训练中也提供了 1.36 倍加速;在迁移学习的辅助下,这导致了准确率的微小下降。我们的工作为机器遗忘中的实际数据治理做出了贡献。

关键词

引用

@article{arxiv.1912.03817,
  title  = {Machine Unlearning},
  author = {Lucas Bourtoule and Varun Chandrasekaran and Christopher A. Choquette-Choo and Hengrui Jia and Adelin Travers and Baiwu Zhang and David Lie and Nicolas Papernot},
  journal= {arXiv preprint arXiv:1912.03817},
  year   = {2020}
}

备注

Published in IEEE S&P 2021