分类模型中的成员推断攻击与防御
密码学与安全
2021-02-04 v3 机器学习
摘要
我们研究针对分类器的成员推断(MI)攻击,其中攻击者的目标是确定某数据实例是否用于训练该分类器。通过对现有MI攻击的系统梳理及对其广泛的实验评估,我们发现模型对MI攻击的脆弱性与泛化差距——即训练准确率与测试准确率之差——紧密相关。随后我们提出一种抵御MI攻击的防御方法,旨在通过有意降低训练准确率来缩小该差距。更具体地,训练过程试图通过一种新的使用训练集与验证集softmax输出经验分布间最大均值差异(Maximum Mean Discrepancy)的{\em 集合正则化器},来匹配训练与验证准确率。我们的实验结果表明,将该方法与另一种简单防御(mix-up训练)结合,可显著改进针对MI攻击的当前最优防御,且对测试准确率影响极小。
引用
@article{arxiv.2002.12062,
title = {Membership Inference Attacks and Defenses in Classification Models},
author = {Jiacheng Li and Ninghui Li and Bruno Ribeiro},
journal= {arXiv preprint arXiv:2002.12062},
year = {2021}
}