中文

Membership-Doctor:针对机器学习模型的成员推断综合评估

密码学与安全 2022-08-23 v1 机器学习

摘要

机器学习模型容易记忆敏感数据,使其易受成员推断攻击,即攻击者旨在推断某个输入样本是否用于训练模型。过去几年中,研究者提出了许多成员推断攻击与防御方法。然而,这些攻击与防御采用了多种策略,并在不同的模型和数据集上进行。缺乏综合基准意味着我们无法理解现有攻击与防御的优缺点。我们通过提出对不同成员推断攻击与防御的大规模测量来填补这一空白。我们通过研究九种攻击和六种防御对成员推断进行系统化,并在整体评估中测量不同攻击与防御的性能。随后我们量化威胁模型对这些攻击结果的影响。我们发现威胁模型的某些假设(如影子模型与目标模型同架构、同分布)是不必要的。我们还首次在从互联网收集的真实世界数据上执行攻击,而非实验室数据集。我们进一步研究是什么决定了成员推断攻击的性能,并揭示出普遍认定的过拟合程度不足以导致攻击成功。相反,成员与非成员样本之间熵/交叉熵的 Jensen-Shannon 距离与攻击性能的相关性更好。这给了我们一种无需运行攻击即可准确预测成员推断风险的新方法。最后,我们发现数据增强在更大程度上降低了现有攻击的性能,并提出了一种利用增强训练影子与攻击模型的自适应攻击,提升了攻击性能。

关键词

引用

@article{arxiv.2208.10445,
  title  = {Membership-Doctor: Comprehensive Assessment of Membership Inference Against Machine Learning Models},
  author = {Xinlei He and Zheng Li and Weilin Xu and Cory Cornelius and Yang Zhang},
  journal= {arXiv preprint arXiv:2208.10445},
  year   = {2022}
}