中文

针对分类模型的黑盒模型反演属性推断攻击

密码学与安全 2020-12-08 v1 机器学习

摘要

机器学习(ML)技术在医疗诊断、生活方式预测和商业决策等隐私敏感领域的日益使用,凸显了有必要更好地理解这些ML技术是否引入了敏感与专有训练数据的泄露。本文关注一类模型反演攻击,其中 adversary(敌手)已知训练数据中实例的非敏感属性,并旨在利用对目标分类模型的预言机访问推断其未知的敏感属性值。我们设计了两种新颖的模型反演属性推断攻击——基于置信度建模的攻击与基于置信度得分的攻击,并将攻击扩展至其他(非敏感)属性中部分也为敌手未知的情形。此外,先前工作使用准确率作为评估属性推断攻击有效性的指标,我们发现当敏感属性分布不平衡时准确率并不具信息量。我们识别出两个更适用于评估属性推断攻击的指标,即G-mean与Matthews相关系数(MCC)。我们在使用两个真实数据集训练的两类机器学习模型(决策树与深度神经网络)上评估了我们的攻击。实验结果表明,我们新提出的攻击显著优于最先进的攻击。此外,我们实证表明训练数据集中的特定群体(按属性如性别、种族分组)可能更易受模型反演攻击。我们还证明当其他(非敏感)属性部分也为敌手未知时,攻击性能未受显著影响。

关键词

引用

@article{arxiv.2012.03404,
  title  = {Black-box Model Inversion Attribute Inference Attacks on Classification Models},
  author = {Shagufta Mehnaz and Ninghui Li and Elisa Bertino},
  journal= {arXiv preprint arXiv:2012.03404},
  year   = {2020}
}