真正有用的合成数据——一种评估差分隐私合成数据质量的框架
机器学习
2021-10-04 v2 机器学习
摘要
近期在生成合成数据方面的进展——允许加入如差分隐私这类有原则的保护隐私方式——是以隐私保护方式共享统计信息的关键一步。但尽管焦点一直放在隐私保证上,所得私有合成数据只有当其仍携带来自原始数据的统计信息时才有用。为了进一步优化数据隐私与数据质量之间的固有权衡,有必要仔细思考后者。数据分析师想要的是什么?承认数据质量是一个主观概念,我们从一个应用研究者的视角开发了一个评估差分隐私合成数据质量的框架。数据质量可沿两个维度衡量。首先,合成数据的质量可针对训练数据或潜在总体进行评估。其次,合成数据的质量取决于分布的一般相似性,或推断与预测等具体任务。显然,同时满足所有目标是一项艰巨挑战。我们邀请学术界共同推动隐私-质量前沿。
引用
@article{arxiv.2004.07740,
title = {Really Useful Synthetic Data -- A Framework to Evaluate the Quality of Differentially Private Synthetic Data},
author = {Christian Arnold and Marcel Neunhoeffer},
journal= {arXiv preprint arXiv:2004.07740},
year = {2021}
}