中文

通过 iDP 验证守护神经网络分类器的标签唯一访问隐私

机器学习 2025-02-27 v2 编程语言

摘要

神经网络易受到可提取训练集私人信息的隐私攻击。为应对此问题,several training algorithms通过向计算过程添加噪声来保证差分隐私(DP)。然而,DP需要考虑每一种可能的训练集,这会显著降低网络的准确性。Individual DP(iDP)将DP限制在给定的训练集上。我们观察到,一些输入在没有任何噪声的情况下确定性地满足iDP。通过识别这些输入,我们可以在准确性轻微下降的情况下,为网络提供iDP标签唯一访问。然而,在没有噪声的情况下识别满足iDP的输入极具挑战性。我们的关键思想是计算iDP确定性界限(iDP-DB),它对不满足iDP的输入集合进行过度包围,并仅对其预测标签添加噪声。为计算最紧致的iDP-DB,以实现最小准确性下降的标签唯一访问保护,我们提出了LUCID,利用several formal verification技术。首先,将问题编码为混合整数线性规划,定义在网络上以及在每个训练相同但不包含唯一数据点的网络上。其次,使用超网络抽象一组网络。第三,通过一种新颖的分支定界技术消除过度近似误差。第四,界定网络中匹配神经元与超网络中匹配神经元的差异,并在它们很小时采用线性松弛。我们展示,LUCID可以为分类器提供完美的个体隐私保证(0-iDP)——这是DP训练算法无法实现的——准确性下降仅为1.4%。对于更宽松的ε\varepsilon-iDP保证,LUCID的准确性下降为1.2%。相比之下,现有的DP训练算法将降低12.7%的准确性。

关键词

引用

@article{arxiv.2502.16519,
  title  = {Guarding the Privacy of Label-Only Access to Neural Network Classifiers via iDP Verification},
  author = {Anan Kabaha and Dana Drachsler-Cohen},
  journal= {arXiv preprint arXiv:2502.16519},
  year   = {2025}
}