中文

生成具有隐私保证的更高保真度合成数据集

机器学习 2020-03-03 v1 人工智能 密码学与安全 机器学习

摘要

本文考虑通过用生成对抗网络(GAN)生成的样本替代真实数据,来增强常见机器学习开发任务(如数据标注和检查)中的用户隐私。我们提出采用贝叶斯差分隐私作为手段,以在提供更好隐私-效用权衡的同时实现严格的理论保证。我们通过实验证明,与先前工作相比,我们的方法生成了更高保真度的样本,从而能够(1)检测更微妙的数据错误和偏差,以及(2)通过在人工样本上直接训练达到高准确率,减少对真实数据标注的需求。

关键词

引用

@article{arxiv.2003.00997,
  title  = {Generating Higher-Fidelity Synthetic Datasets with Privacy Guarantees},
  author = {Aleksei Triastcyn and Boi Faltings},
  journal= {arXiv preprint arXiv:2003.00997},
  year   = {2020}
}

备注

7 pages, 4 figures, 1 table