中文

基于聚合的标签差分隐私

机器学习 2023-11-28 v3 机器学习

摘要

在许多现实应用中,由于隐私领域的最新发展,训练数据可能被聚合以保护敏感训练标签的隐私。在标签比例学习(LLP)框架中,数据集被划分为特征向量袋,仅提供每袋标签之和。进一步的限制,我们称之为从袋聚合学习(LBA),即仅提供每袋特征向量的(可能加权的)和,而非单个特征向量。我们研究此类聚合技术是否能在先前研究的标签差分隐私(label-DP)概念下提供隐私保证,例如 [Chaudhuri-Hsu'11, Ghazi et al.'21, Esfandiari et al.'22]。易见朴素的 LBA 和 LLP 不提供 label-DP。然而,我们的主要结果表明,使用 iid 高斯权重对 mm 个随机采样的互不相交的 kk 大小袋进行加权 LBA,实际上对于任意 ε>0\varepsilon > 0(ε,δ)(\varepsilon, \delta)-label-DP,其中 δexp(Ω(k))\delta \approx \exp(-\Omega(\sqrt{k})),前提是线性均方误差回归损失有下界。此外,在聚合数据集上最小化损失的 22\ell_2^2-回归器,其损失在原始数据集最优解的 (1+o(1))\left(1 + o(1)\right) 倍以内,概率为 1exp(Ω(m))\approx 1 - exp(-\Omega(m))。我们强调无需添加标签噪声。类似的加权 LLP 则不接受 label-DP。尽管如此,我们表明如果对任意常数比例的实例标签添加 N(0,1)N(0, 1) 噪声,则带噪加权 LLP 在不对数据集作假设的情况下具有类似的 label-DP 保证,同时保持 Lipschitz 有界神经均方误差回归任务的效用。我们的工作是首个证明 label-DP 可通过随机加权聚合在回归任务中实现,且使用无或极少加性噪声。

关键词

引用

@article{arxiv.2310.10092,
  title  = {Label Differential Privacy via Aggregation},
  author = {Anand Brahmbhatt and Rishi Saket and Shreyas Havaldar and Anshul Nasery and Aravindan Raghuveer},
  journal= {arXiv preprint arXiv:2310.10092},
  year   = {2023}
}