迈向机器遗忘的概率化验证
密码学与安全
2020-12-02 v2 机器学习
机器学习
摘要
被遗忘权,亦称擦除权,是个体要求其数据从存储实体处被删除的权利。这一长期存在的概念近期由欧盟《通用数据保护条例》(GDPR)在法律上予以固化。因此,需要一些机制使用户能够验证服务提供商是否遵从了其删除请求。本工作中,我们迈出第一步,提出一个形式化框架,用于在提供机器学习即服务(MLaaS)的系统中研究此类数据删除请求——亦称机器遗忘——的验证机制设计。我们的框架允许基于标准假设检验对任意验证机制进行严格量化。此外,我们提出一种新颖的基于后门的验证机制,并展示其在以高置信度证明数据删除方面的有效性,从而为定量推断机器遗忘提供基础。我们在多种网络架构(如多层感知机(MLP)、卷积神经网络(CNN)、残差网络(ResNet)与长短期记忆(LSTM))以及5个不同数据集上评估了我们的方法。我们表明该方法对ML服务准确率影响极小,却能提供高置信度的遗忘验证。我们提出的机制即便仅少数用户采用本系统来确认数据删除请求的合规性也有效。特别地,仅5%用户参与、对其一半数据以後门修改、且仅需30次测试查询时,我们的验证机制的假阳性与假阴性比率均低于。我们还通过对抗一个采用最先进后门防御方法的自适应敌手测试,展示了方法的有效性。
引用
@article{arxiv.2003.04247,
title = {Towards Probabilistic Verification of Machine Unlearning},
author = {David Marco Sommer and Liwei Song and Sameer Wagh and Prateek Mittal},
journal= {arXiv preprint arXiv:2003.04247},
year = {2020}
}
备注
code is available at https://github.com/inspire-group/unlearning-verification