MemGuard:通过对抗样本防御黑盒成员推断攻击
密码学与安全
2019-12-20 v3 机器学习
摘要
在成员推断攻击中,攻击者的目标是推断某个数据样本是否属于目标分类器的训练数据集。具体而言,在给定对目标分类器的黑盒访问权限下,攻击者训练一个二分类器,该分类器以目标分类器预测的数据样本置信度分数向量作为输入,并预测该数据样本为目标分类器训练数据集的成员或非成员。成员推断攻击对训练数据集构成严重的隐私与安全威胁。现有大多数防御在训练目标分类器时利用差分隐私或正则化目标分类器的训练过程。这些防御存在两个关键局限:1)它们对置信度分数向量没有正式的效用损失保证;2)它们实现了次优的隐私-效用权衡。本工作中,我们提出 MemGuard,首个针对黑盒成员推断攻击具有正式效用损失保证的防御。MemGuard 不篡改目标分类器的训练过程,而是向目标分类器预测的每一个置信度分数向量添加噪声。我们的关键观察是,攻击者使用分类器预测成员或非成员,而分类器易受对抗样本攻击。基于该观察,我们提出向置信度分数向量添加精心构造的噪声向量,将其转化为误导攻击者分类器的对抗样本。我们在三个数据集上的实验结果表明,MemGuard 能有效防御成员推断攻击,并实现比现有防御更好的隐私-效用权衡。我们的工作是首个表明对抗样本可用作防御机制来抵御成员推断攻击的研究。
引用
@article{arxiv.1909.10594,
title = {MemGuard: Defending against Black-Box Membership Inference Attacks via Adversarial Examples},
author = {Jinyuan Jia and Ahmed Salem and Michael Backes and Yang Zhang and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:1909.10594},
year = {2019}
}
备注
ACM CCS 2019, code is available at this: https://github.com/jjy1994/MemGuard