论成员推断攻击的困难性
机器学习
2021-03-24 v3 密码学与安全
计算机视觉与模式识别
机器学习
摘要
近期研究提出了针对深度模型的成员推断(MI)攻击,其目标是推断某个样本是否曾用于训练过程。尽管这些研究看似成功,但它们仅报告了正类(成员类)的准确率、精确率和召回率。因此,这些攻击在负类(非成员类)上的性能尚未被清晰报告。本文指出,MI攻击性能的报告方式常常具有误导性,因为它们存在未被报告的高假阳性率或虚警率(FAR)。FAR表示攻击模型将非训练样本(非成员)误标为训练(成员)样本的频率。高FAR使得MI攻击从根本上不实用,对于成员推断这类现实中绝大多数样本属于负类(非训练类)的任务尤为显著。此外,我们表明当前的MI攻击模型最多只能以平庸的准确率识别被误分类样本的隶属关系,而这类样本仅占训练样本的极小部分。我们分析了若干此前未被全面探索用于成员推断的新特征,包括到决策边界的距离和梯度范数,并得出结论:深度模型在训练与非训练样本上的响应大多相似。我们在图像分类任务上进行了多项实验,包括MNIST、CIFAR-10、CIFAR-100和ImageNet,使用了多种模型架构,包括LeNet、AlexNet、ResNet等。我们表明,即便攻击者被赋予若干优势,当前最先进的MI攻击也无法同时实现高准确率和低FAR。源代码见 https://github.com/shrezaei/MI-Attack。
引用
@article{arxiv.2005.13702,
title = {On the Difficulty of Membership Inference Attacks},
author = {Shahbaz Rezaei and Xin Liu},
journal= {arXiv preprint arXiv:2005.13702},
year = {2021}
}