中文

成员推断攻击中预测分数是否可信

机器学习 2023-01-25 v3 密码学与安全 计算机视觉与模式识别

摘要

成员推断攻击(MIAs)旨在判断特定样本是否用于训练预测模型。知晓这一点确实可能导致隐私泄露。然而,大多数MIAs利用模型的预测分数——给定某些输入时各输出的概率——其直觉是训练后的模型在其训练数据上往往表现不同。我们认为,对于许多现代深度网络架构而言,这是一种谬误。因此,MIAs将惨败,因为过度自信不仅会在已知域上,还会在分布外数据上导致高假阳性率,并隐式地充当针对MIAs的防御。具体而言,利用生成对抗网络(GAN),我们能够生成潜在无限数量的被误分类为训练数据一部分的样本。换言之,MIAs的威胁被高估了,且泄露的信息少于先前假设。此外,模型的过度自信与其对MIAs的易感性之间实际上存在权衡:分类器越能在不知时做出低置信度预测,就越会暴露训练数据。

关键词

引用

@article{arxiv.2111.09076,
  title  = {To Trust or Not To Trust Prediction Scores for Membership Inference Attacks},
  author = {Dominik Hintersdorf and Lukas Struppek and Kristian Kersting},
  journal= {arXiv preprint arXiv:2111.09076},
  year   = {2023}
}

备注

15 pages, 8 figures, 10 tables