中文

利用对抗扰动对深度神经网络进行成员推断攻击

机器学习 2023-07-12 v1 密码学与安全

摘要

已有若干成员推断(MI)攻击被提出以审计目标DNN。给定一组样本,MI攻击可判别哪些样本在训练期间被目标DNN见过。本工作关注训练后MI攻击,强调高置信度成员检测——在低假正率(FPR)下的真正率(TPR)。该类别的当前工作——似然比攻击(LiRA)和增强MI攻击(EMIA)——仅在复杂数据集(如CIFAR-10和Imagenet)上表现良好,目标DNN会过拟合其训练集,但在更简单数据集上表现不佳(在Fashion-MNIST上两种攻击TPR均为0%,在MNIST上1% FPR时LiRA和EMIA的TPR分别为2%和0%)。为此,首先,我们通过提出一个分为准备、指示和决策三阶段的框架统一了当前的MI攻击。其次,我们利用该框架提出两种新型攻击:(1) 对抗成员推断攻击(AMIA)高效利用样本的成员与非成员信息,同时对抗性地最小化一种新颖损失函数,在Fashion-MNIST和MNIST数据集上均达到6% TPR;(2) 增强AMIA(E-AMIA)结合EMIA与AMIA,在1% FPR下于Fashion-MNIST和MNIST数据集上分别达到8%和4% TPR。第三,我们引入两种新颖的增广指示器,它们在样本的高斯邻域中正向利用损失信息。这在1% FPR下使四种攻击在Fashion-MNIST和MNIST数据集上的TPR平均分别提升2.5%和0.25%。最后,我们提出简单而新颖的评估指标——给定FPR下的运行TPR平均值(RTA),能更好区分低FPR区域的不同MI攻击。我们还表明,与LiRA和EMIA相比,AMIA和E-AMIA对未知DNN(目标DNN之外)更具可迁移性,且对DP-SGD训练更鲁棒。

关键词

引用

@article{arxiv.2307.05193,
  title  = {Membership Inference Attacks on DNNs using Adversarial Perturbations},
  author = {Hassan Ali and Adnan Qayyum and Ala Al-Fuqaha and Junaid Qadir},
  journal= {arXiv preprint arXiv:2307.05193},
  year   = {2023}
}