中文

白盒设定下错位对成员隐私的影响研究

密码学与安全 2024-03-14 v2 机器学习

摘要

机器学习模型已被证明会泄露其训练数据集的敏感信息。模型正日益部署于设备上,这引发了担忧:与仅提供查询访问的黑盒访问相比,对模型参数的白盒访问扩大了攻击面。将影子建模技术直接从黑盒扩展到白盒设定,总体上已被证明并不优于仅黑盒攻击。一个潜在原因是错位,这是深度神经网络的一个已知特性。在影子建模语境中,错位意味着,虽然影子模型在各层学习了相似特征,但这些特征位于不同位置。我们在此首次对影子模型中错位的成因进行系统分析,并表明使用不同的权重初始化是主要原因。随后,我们将模型融合文献中先前开发的几种重新对齐技术扩展到影子建模语境,其目标是将影子模型的各层重新对齐到目标模型的各层。我们表明重新对齐技术显著降低了测得的目标与影子模型之间的错位。最后,我们对白盒成员推断攻击(MIA)进行了全面评估。我们的分析揭示,基于内部层激活的MIA深受影子模型错位的严重影响,而基于梯度的MIA仅有时受到显著影响。我们表明重新对齐影子模型大幅提升了前者的性能,也可能提升后者的性能,尽管频率较低。综上,我们的结果突显了设备端部署扩大了攻击面,且新可用的信息可被用于构建更强大的攻击。

关键词

引用

@article{arxiv.2306.05093,
  title  = {Investigating the Effect of Misalignment on Membership Privacy in the White-box Setting},
  author = {Ana-Maria Cretu and Daniel Jones and Yves-Alexandre de Montjoye and Shruti Tople},
  journal= {arXiv preprint arXiv:2306.05093},
  year   = {2024}
}

备注

To appear in the Proceedings on Privacy Enhancing Technologies (PoPETs 2024)