中文

梯度相似:DP-SGD 中的敏感度常被高估

机器学习 2024-07-17 v3 人工智能 密码学与安全 机器学习

摘要

差分隐私随机梯度下降(DP-SGD)是私有深度学习的经典方法。尽管当前对 DP-SGD 的隐私分析在某些设定下已知是紧的,若干实证结果表明,在常见基准数据集上训练的模型对许多数据点的隐私泄露显著更少。然而,尽管已有过往尝试,对于为何如此仍缺乏严谨解释。是因为在这些数据集设定下存在更紧的隐私上界,还是我们的攻击对某些数据点不够强?本文首次给出 DP-SGD 的逐实例(即“数据依赖”)差分隐私分析。我们的分析捕捉了如下直觉:数据集中具有相似邻居的点比离群点享有更好的数据依赖隐私。形式上,这通过修改 DP-SGD 的逐步隐私分析以引入对从训练数据集计算的模型更新分布的依赖来实现。我们进一步提出了一种新的组合定理,以有效利用这一新的逐步分析来推断整个训练过程。综合来看,我们的评估表明,这一新颖的 DP-SGD 分析使我们如今能够正式表明,DP-SGD 在常见基准上训练时对许多数据点的隐私泄露显著少于当前的数据独立保证。这意味着若 adversary 对可能训练数据集的控制不足,隐私攻击必然会对许多数据点失效。

关键词

引用

@article{arxiv.2307.00310,
  title  = {Gradients Look Alike: Sensitivity is Often Overestimated in DP-SGD},
  author = {Anvith Thudi and Hengrui Jia and Casey Meehan and Ilia Shumailov and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2307.00310},
  year   = {2024}
}

备注

published in 33rd USENIX Security Symposium