中文

后门是否有助于成员推断攻击?

密码学与安全 2023-03-23 v1 机器学习

摘要

当 adversary 向机器学习模型提供投毒样本时,诸如成员推断攻击(推断某样本是否包含在模型训练中)之类的隐私泄露会通过将该样本变为离群值而变得有效。然而,由于投毒样本导致推断精度下降,这些攻击可被检测到。在本文中,我们讨论了一种基于后门的新型成员推断攻击——后门辅助成员推断攻击(backdoor-assisted membership inference attack),该攻击对触发样本返回 adversary 期望的输出。我们通过学术基准数据集的实验发现了三个关键见解。我们首先证明后门辅助成员推断攻击是不成功的。其次,当我们分析损失分布以理解不成功结果的原因时,我们发现后门无法分离训练样本与非训练样本的损失分布。换言之,后门无法影响干净样本的分布。第三,我们还表明投毒样本与触发样本激活了不同分布的神经元。具体而言,与投毒样本相反,后门使任何干净样本成为内点。因此,我们确认后门无法协助成员推断。

关键词

引用

@article{arxiv.2303.12589,
  title  = {Do Backdoors Assist Membership Inference Attacks?},
  author = {Yumeki Goto and Nami Ashizawa and Toshiki Shibahara and Naoto Yanai},
  journal= {arXiv preprint arXiv:2303.12589},
  year   = {2023}
}