中文

生成满足差分隐私的分类数据:构想及其在机器学习中的应用

密码学与安全 2022-04-05 v1 机器学习

摘要

私人和公共组织定期收集并分析关于其同事、志愿者、客户等的数字化数据。然而,由于大多数个人数据都是敏感的,设计隐私保护系统面临关键挑战。为应对隐私问题,研究界提出了不同的隐私保护方法,其中差分隐私(DP)作为一种形式化定义脱颖而出,它允许量化隐私-效用的权衡。此外,在本地差分隐私(LDP)模型下,用户可以在将数据发送到服务器之前在本地对其数据进行清洗。因此,本论文的目标有两个:O1_1)在LDP保证下改进多重频率估计中的效用与隐私,这是统计学习的基础。以及O2_2)评估在差分隐私数据上训练的机器学习(ML)模型的隐私-效用权衡。对于O1_1,我们首先从两个“多重”视角(即跨时间的多个属性和多次收集)切入该问题,同时关注效用。其次,我们将注意力仅集中在多个属性方面,提出了一种在保持效用的同时关注隐私的解决方案。在这两种情况下,我们通过分析和实验验证证明了我们所提解决方案相对于最先进的LDP协议的优势。对于O2_2,我们实证评估了旨在解决现实问题同时确保DP保证的基于ML的解决方案。实际上,我们主要使用了隐私保护ML文献中的输入数据扰动设定。这是整个数据集被独立清洗的情况,因此我们从集中式数据所有者的角度实现了LDP算法。在所有情况下,我们均得出结论:差分隐私ML模型达到了与非私有模型几乎相同的效用指标。

关键词

引用

@article{arxiv.2204.00850,
  title  = {Production of Categorical Data Verifying Differential Privacy: Conception and Applications to Machine Learning},
  author = {Héber H. Arcolezi},
  journal= {arXiv preprint arXiv:2204.00850},
  year   = {2022}
}

备注

Ph.D. Thesis defended in January 2022 at the University Bourgogne Franche-Comt\'e. Supervisor: Jean-Fran\c{c}ois Couchot