中文

DP-UTIL:机器学习中差分隐私的综合效用分析

密码学与安全 2021-12-28 v1 机器学习

摘要

差分隐私(Differential Privacy, DP)已成为一种用于推理可量化隐私泄露的严格形式化方法。在机器学习(ML)中,DP 被用于限制对训练样本的推断/披露。先前工作将 DP 应用于 ML 流水线中,但往往是孤立的,通常聚焦于如梯度扰动等机制。在本文中,我们提出 DP-UTIL,一个跨 ML 流水线的 DP 整体效用分析框架,重点关注输入扰动、目标扰动、梯度扰动、输出扰动和预测扰动。给定一项基于隐私敏感数据的 ML 任务,DP-UTIL 使 ML 隐私从业者能够对这五个扰动点上 DP 的影响进行整体比较分析,以模型效用损失、隐私泄露以及真实暴露的训练样本数量来衡量。我们在视觉、医疗和金融数据集上的分类任务上评估了 DP-UTIL,使用两种代表性学习算法(逻辑回归和深度神经网络)并以成员推断攻击作为案例研究攻击。我们结果的一个亮点是,预测扰动在所有数据集上的所有模型中始终实现最低的效用损失。在逻辑回归模型中,与其他扰动技术相比,目标扰动导致最低的隐私泄露。对于深度神经网络,梯度扰动导致最低的隐私泄露。此外,我们在真实暴露记录上的结果表明,随着隐私泄露增加,差分隐私模型暴露出更多数量的成员样本。总体而言,我们的发现表明,要就使用哪种扰动机制做出明智决策,ML 隐私从业者需要考察优化技术(凸与非凸)、扰动机制、类别数量和隐私预算之间的动态关系。

关键词

引用

@article{arxiv.2112.12998,
  title  = {DP-UTIL: Comprehensive Utility Analysis of Differential Privacy in Machine Learning},
  author = {Ismat Jarin and Birhanu Eshete},
  journal= {arXiv preprint arXiv:2112.12998},
  year   = {2021}
}

备注

To appear in proceedings of the 12th ACM Conference on Data and Application Security and Privacy (CODASPY 2022)