一种基于距离的原始全合成数据生成方法的统计性质与隐私保证
机器学习
2023-10-11 v1 机器学习
摘要
引言:原始研究产生的数据量呈指数增长。为符合开放科学原则,建议公开发布这些数据。然而,从人类参与者收集的数据不能原样发布而不引发隐私担忧。全合成数据是对此挑战的一种有前景的回答。法国 Centre de Recherche en Épidémiologie et Santé des Populations 以基于分类与回归树和一种原始的基于距离的过滤的合成数据生成框架形式探索了这一方法。本工作的目标是开发该框架的精炼版本,并利用经验和形式化工具(包括为本评估目的开发的新型工具)评估其风险-效用特征。材料与方法:我们的合成框架由四个连续步骤组成,每步旨在防止特定的披露风险。我们通过将其中两个或更多步骤应用于一个丰富的流行病学数据集来评估其性能。为所得各合成数据集计算了隐私和效用度量,并进一步使用机器学习方法进行了评估。结果:计算度量显示每个合成数据集对属性披露攻击具有满意的保护水平,尤其是在使用完整框架时。成员披露攻击被形式化地防止,且未显著改变数据。机器学习方法显示模拟的单独识别和可链接性攻击成功风险低。与原始数据的分布和推断相似性在所有数据集中都很高。讨论:本工作展示了使用多步框架生成可公开发布合成数据的技术可行性。专为本演示开发的形式化和经验工具是对该领域的宝贵贡献。进一步研究应聚焦于这些工具的扩展与验证,以努力明确替代数据合成方法的内在质量。结论:通过成功评估使用新型多步合成数据生成框架所产数据的质量,我们展示了 Open-CESP 倡议的技术和概念合理性,其似乎已成熟可供全面实施。
引用
@article{arxiv.2310.06571,
title = {Statistical properties and privacy guarantees of an original distance-based fully synthetic data generation method},
author = {Rémy Chapelle and Bruno Falissard},
journal= {arXiv preprint arXiv:2310.06571},
year = {2023}
}