从模型解释推断敏感属性
密码学与安全
2022-09-09 v2 机器学习
摘要
模型解释为模型构建者提供了对训练好的机器学习模型黑箱行为的透明度。它们指示了不同输入属性对其相应模型预测的影响。解释对输入的依赖性引发了敏感用户数据的隐私担忧。然而,当前文献对模型解释的隐私风险讨论有限。我们关注属性推断攻击这一特定隐私风险,其中 adversary 在给定输入模型解释的情况下推断该输入的敏感属性(如种族和性别)。我们设计了首个针对模型解释的属性推断攻击,涵盖两种威胁模型:模型构建者要么(a)在训练数据和输入中包含敏感属性,要么(b)通过不在训练数据和输入中包含敏感属性来审查敏感属性。我们在四个基准数据集和四种最先进算法上评估了所提出的攻击。我们表明,adversary 在两种威胁模型中均能准确地从解释成功推断敏感属性的值。此外,即便仅利用对应于敏感属性的解释,攻击也成功。这些表明我们的攻击对解释有效,并对数据隐私构成实际威胁。在将模型预测(先前攻击所利用的攻击面)与解释结合时,我们注意到攻击成功率并未提升。此外,利用模型解释的攻击成功率优于仅利用模型预测。这些表明模型解释是 adversary 可利用的强攻击面。
引用
@article{arxiv.2208.09967,
title = {Inferring Sensitive Attributes from Model Explanations},
author = {Vasisht Duddu and Antoine Boutet},
journal= {arXiv preprint arXiv:2208.09967},
year = {2022}
}
备注
ACM CIKM 2022