窃取的记忆:利用模型记忆实现校准的白盒成员推断
机器学习
2020-06-26 v2 密码学与安全
机器学习
摘要
成员推断(MI)攻击利用了机器学习算法有时会通过习得模型泄露其训练数据信息这一事实。本文研究白盒设定下的成员推断,以利用模型内部信息,而此前工作尚未有效利用这些信息。借助关于深度神经网络中过拟合如何发生的新见解,我们展示了模型对特征的独特使用如何为白盒攻击者提供成员身份的证据——即使模型的黑盒行为似乎泛化良好——并证明该攻击优于先前的黑盒方法。我们认为有效的攻击应能提供置信度高的正向推断,发现以往攻击通常无法为高置信度推断成员身份提供有意义的基础,而我们的攻击可被有效校准以实现高精度。最后,我们考察了针对 MI 攻击的流行防御方法,发现:(1) 较小的泛化误差不足以阻止对真实模型的攻击;(2) 虽然小 ε 差分隐私会降低攻击有效性,但这往往以模型准确度的显著损失为代价;而对于实践中有时使用的较大 ε(例如 ε=16),该攻击几乎能达到与未受保护模型相同的准确度。
引用
@article{arxiv.1906.11798,
title = {Stolen Memories: Leveraging Model Memorization for Calibrated White-Box Membership Inference},
author = {Klas Leino and Matt Fredrikson},
journal= {arXiv preprint arXiv:1906.11798},
year = {2020}
}
备注
appearing in USENIX 2020