SHAPr:一种高效且通用的机器学习成员隐私风险度量
密码学与安全
2022-09-07 v2 机器学习
摘要
用于训练机器学习(ML)模型的数据可能是敏感的。成员推断攻击(MIA)试图确定特定数据记录是否用于训练某个ML模型,存在侵犯成员隐私的风险。ML模型构建者需要一种原则性的度量定义,以量化(a)单个训练数据记录的成员隐私风险,(b)独立于特定MIA进行计算,(c)评估对不同MIA的易感性,(d)可用于不同应用,且(e)高效。先前的成员隐私风险度量均无法同时满足所有这些要求。我们提出SHAPr,一种基于Shapley值的成员隐私度量,它是一种留一法(LOO)技术,最初旨在衡量训练数据记录对模型效用的贡献。我们推测对模型效用的贡献可作为记忆化的代理,从而表征成员隐私风险。使用十个基准数据集,我们证明SHAPr在估计训练数据记录对MIA的易感性方面确实有效。我们还表明,与先前工作不同,SHAPr在估计对更新且更有效的MIA的易感性方面显著更优。我们将SHAPr应用于评估多种针对MIA的防御措施的效果:使用正则化以及移除高风险训练数据记录。此外,SHAPr具有通用性:它可用于估计不同子组对MIA的脆弱性,并继承了Shapley值的应用(例如数据估值)。我们表明,SHAPr具有可接受的计算成本(相较于朴素LOO),从最小数据集的数分钟到最大数据集的约92分钟不等。
引用
@article{arxiv.2112.02230,
title = {SHAPr: An Efficient and Versatile Membership Privacy Risk Metric for Machine Learning},
author = {Vasisht Duddu and Sebastian Szyller and N. Asokan},
journal= {arXiv preprint arXiv:2112.02230},
year = {2022}
}