成员推断攻击中预测分数是否可信
机器学习
2023-01-25 v3 密码学与安全
计算机视觉与模式识别
摘要
成员推断攻击(MIAs)旨在判断特定样本是否用于训练预测模型。知晓这一点确实可能导致隐私泄露。然而,大多数MIAs利用模型的预测分数——给定某些输入时各输出的概率——其直觉是训练后的模型在其训练数据上往往表现不同。我们认为,对于许多现代深度网络架构而言,这是一种谬误。因此,MIAs将惨败,因为过度自信不仅会在已知域上,还会在分布外数据上导致高假阳性率,并隐式地充当针对MIAs的防御。具体而言,利用生成对抗网络(GAN),我们能够生成潜在无限数量的被误分类为训练数据一部分的样本。换言之,MIAs的威胁被高估了,且泄露的信息少于先前假设。此外,模型的过度自信与其对MIAs的易感性之间实际上存在权衡:分类器越能在不知时做出低置信度预测,就越会暴露训练数据。
引用
@article{arxiv.2111.09076,
title = {To Trust or Not To Trust Prediction Scores for Membership Inference Attacks},
author = {Dominik Hintersdorf and Lukas Struppek and Kristian Kersting},
journal= {arXiv preprint arXiv:2111.09076},
year = {2023}
}
备注
15 pages, 8 figures, 10 tables