中文

仅标签成员推断攻击

密码学与安全 2021-12-07 v3 机器学习 机器学习

摘要

成员推断攻击是机器学习模型隐私泄露最简单的形式之一:给定数据点和模型,判断该点是否用于训练模型。现有成员推断攻击利用模型在查询其训练数据时的异常置信度。若 adversary 仅能访问模型预测标签而无置信度度量,这些攻击便不适用。在本文中,我们引入仅标签成员推断攻击。我们的攻击不依赖置信度分数,而是评估模型预测标签在扰动下的鲁棒性以获得细粒度成员信号。这些扰动包括常见数据增强或对抗样本。我们经实证表明,我们的仅标签成员推断攻击性能与先前需要访问模型置信度的攻击相当。我们进一步证明,仅标签攻击攻破了多种针对成员推断攻击的防御,这些防御(隐式或显式)依赖于一种我们称为置信度掩蔽的现象。这些防御修改模型的置信度分数以阻止攻击,但保持模型预测标签不变。我们的仅标签攻击表明,置信度掩蔽并非针对成员推断的可行防御策略。最后,我们研究最坏情况仅标签攻击,即对少量离群数据点推断成员关系。我们表明在此设定下仅标签攻击也与基于置信度的攻击匹配。我们发现,采用差分隐私和(强)L2正则化训练模型是唯一已知能成功阻止所有攻击的防御策略。即便差分隐私预算过高而无法提供有意义的可证明保证时,这一点仍然成立。

关键词

引用

@article{arxiv.2007.14321,
  title  = {Label-Only Membership Inference Attacks},
  author = {Christopher A. Choquette-Choo and Florian Tramer and Nicholas Carlini and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2007.14321},
  year   = {2021}
}

备注

16 pages, 11 figures, 2 tables Revision 2: 19 pages, 12 figures, 3 tables. Improved text and additional experiments. Final ICML paper