中文

用于高效重识别风险控制的差分隐私数据合成

机器学习 2024-04-24 v3 密码学与安全

摘要

保护用户数据隐私可通过多种方法实现,从统计变换到生成模型不一而足。然而,它们都存在关键缺陷。例如,使用传统技术创建变换后的数据集极为耗时。此外,近期基于深度学习的方案除训练阶段漫长外还需大量计算资源,而基于差分隐私的方案可能损害数据效用。本文提出ϵ\epsilon-PrivateSMOTE,一种旨在防范重识别与关联攻击的技术,特别针对高\sloppy重识别风险的情形。我们的方案将基于噪声插值的合成数据生成与差分隐私原则相结合,以混淆高风险样本。我们展示了ϵ\epsilon-PrivateSMOTE相较于多种传统及最先进的隐私保护方法(包括生成对抗网络、变分自编码器和差分隐私基线)在隐私风险上取得有竞争力的结果且具备更优的预测性能。我们还表明该方法将时间需求至少缩减9倍,是一种无需专用硬件即可保障高性能的资源高效方案。

关键词

引用

@article{arxiv.2212.00484,
  title  = {Differentially-Private Data Synthetisation for Efficient Re-Identification Risk Control},
  author = {Tânia Carvalho and Nuno Moniz and Luís Antunes and Nitesh Chawla},
  journal= {arXiv preprint arXiv:2212.00484},
  year   = {2024}
}

备注

21 pages, 6 figures and 2 tables