中文

罗宾汉效应与马太效应:差分隐私对合成数据产生差异性影响

机器学习 2022-06-28 v3 人工智能 密码学与安全 计算机与社会

摘要

采用差分隐私(DP)训练的 generative 模型可用于生成合成数据,同时将隐私风险降至最低。我们分析了DP对这些模型相对于数据中代表性不足的类/子群的影响,具体研究:1)合成数据中类/子群的规模,以及2)在其上运行的分类任务的准确性。我们还评估了不同不平衡程度与隐私预算的影响。我们的分析使用了三种最先进的DP模型(PrivBayes、DP-WGAN 和 PATE-GAN),表明DP在生成的合成数据中产生相反的尺寸分布。它影响多数类与少数类/子群之间的差距;在某些情况下缩小该差距(“罗宾汉”效应),而在另一些情况下扩大该差距(“马太”效应)。无论哪种方式,这都会导致对合成数据上分类任务准确性的(相似的)差异性影响,对数据中代表性不足的部分影响尤为不成比例。因此,当在合成数据上训练模型时,可能会承担对不同子群体不平等对待的风险,从而导致不可靠或不公平的结论。

关键词

引用

@article{arxiv.2109.11429,
  title  = {Robin Hood and Matthew Effects: Differential Privacy Has Disparate Impact on Synthetic Data},
  author = {Georgi Ganev and Bristena Oprisanu and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2109.11429},
  year   = {2022}
}