生成具有隐私保证的更高保真度合成数据集
机器学习
2020-03-03 v1 人工智能
密码学与安全
机器学习
摘要
本文考虑通过用生成对抗网络(GAN)生成的样本替代真实数据,来增强常见机器学习开发任务(如数据标注和检查)中的用户隐私。我们提出采用贝叶斯差分隐私作为手段,以在提供更好隐私-效用权衡的同时实现严格的理论保证。我们通过实验证明,与先前工作相比,我们的方法生成了更高保真度的样本,从而能够(1)检测更微妙的数据错误和偏差,以及(2)通过在人工样本上直接训练达到高准确率,减少对真实数据标注的需求。
引用
@article{arxiv.2003.00997,
title = {Generating Higher-Fidelity Synthetic Datasets with Privacy Guarantees},
author = {Aleksei Triastcyn and Boi Faltings},
journal= {arXiv preprint arXiv:2003.00997},
year = {2020}
}
备注
7 pages, 4 figures, 1 table