基于留出法的混合类型合成数据保真度与隐私评估
机器学习
2021-04-02 v1 机器学习
摘要
基于 AI 的数据合成在过去几年取得快速进展,并因其实现尊重隐私的高保真数据共享的潜力而日益受到认可。然而,充分评估生成合成数据集的质量仍是一项开放挑战。我们引入并演示了一种基于留出法的经验评估框架,用于量化混合类型表格数据合成数据方案的保真度与隐私风险。保真度度量基于低维边际分布的统计距离,其提供了一种无模型且易于沟通的经验度量,用于衡量合成数据集的代表性。隐私风险通过计算相对于训练数据的个体级最近记录距离来评估。通过表明合成样本与训练数据的距离和与留出数据的距离一样近,我们给出有力证据:合成器确实学会了泛化模式且独立于个体训练记录。我们在四个混合类型数据集上针对七种不同合成数据方案演示了所提框架,并将其与更传统的统计披露技术进行比较。结果凸显了系统评估这类新兴合成数据生成器的保真度与隐私的必要性。
引用
@article{arxiv.2104.00635,
title = {Holdout-Based Fidelity and Privacy Assessment of Mixed-Type Synthetic Data},
author = {Michael Platzer and Thomas Reutterer},
journal= {arXiv preprint arXiv:2104.00635},
year = {2021}
}
备注
12 pages, 9 figures