中文

我们能否从深度学习模型权重推断差分隐私的存在?迈向更安全的深度学习

机器学习 2023-11-21 v1 人工智能 密码学与安全

摘要

差分隐私(Differential Privacy, DP)是保护数据与模型免受完整性攻击的关键属性。在深度学习(Deep Learning, DL)领域,它通常通过差分隐私随机梯度下降(DP-SGD)来实现。然而,当模型被共享或发布时,无法检查它是否差分私有的,即需要信任模型提供方。在数据隐私具有强制性(尤其鉴于当前数据法规)的情况下,这带来了一个问题,因为 DP 的存在无法由任何第三方一致地认证。因此,我们面临如下挑战:根据标题问题,我们能否从深度学习模型权重推断差分隐私的存在?由于 DP-SGD 显著改变了 DL 模型的训练过程,我们假设 DP 在 DL 模型权重中留下了印记,可用于预测一个模型是否经过 DP 训练,而与其架构和训练数据集无关。在本文中,我们提出利用使用 DP 在模型权重中留下的印记来推断 DL 模型中 DP 训练的存在。为证实我们的假设,我们开发了一种基于两个 DL 模型权重数据集的实验方法,每个数据集包含有和无 DP 训练的模型,以及一个元分类器,通过访问其权重来推断 DL 模型的训练过程中是否使用了 DP。我们同时消除了对可信模型提供方的需求,并为这一有趣的研究方向奠定了坚实基础。因此,我们的贡献是在 DL 模型中 DP 训练的严格隐私要求之上的一层额外安全性,迈向 DL 模型。

关键词

引用

@article{arxiv.2311.11717,
  title  = {Can we infer the presence of Differential Privacy in Deep Learning models' weights? Towards more secure Deep Learning},
  author = {Jiménez-López and Daniel and Rodríguez-Barroso and Nuria and Luzón and M. Victoria and Herrera and Francisco},
  journal= {arXiv preprint arXiv:2311.11717},
  year   = {2023}
}