面向表格数据的端到端机器学习流水线中差分隐私合成数据的效用与公平性评估
机器学习
2023-10-31 v1 密码学与安全
摘要
差分隐私(DP)合成数据集是一种在保护个体数据提供方隐私的同时共享数据的解决方案。理解在端到端机器学习流水线中使用 DP 合成数据的影响,关乎医疗健康和人道主义行动等领域,这些领域数据稀缺且受严格隐私法规约束。本工作中,我们研究了合成数据在多大程度上可替代真实的表格数据用于机器学习流水线,并识别出用于训练和评估机器学习模型的最有效合成数据生成技术。我们从效用与公平性两个角度考察了差分隐私合成数据对下游分类任务的影响。我们的分析全面,涵盖了两类主要合成数据生成算法的代表:基于边际的与基于 GAN 的。据我们所知,我们的工作是首个:(i) 提出一种训练与评估框架,其不假设可用于测试在合成数据上训练的机器学习模型效用与公平性的真实数据可用;(ii) 就用于训练机器学习模型的效用与公平性,对合成数据集生成算法给出最广泛的分析;以及 (iii) 涵盖若干不同的公平性定义。我们的发现表明,就表格数据的模型训练效用而言,基于边际的合成数据生成器优于基于 GAN 的生成器。事实上,我们展示了使用基于边际算法生成的数据训练的模型可表现出与使用真实数据训练的模型相近的效用。我们的分析还揭示,基于边际的合成数据生成器 MWEM PGM 能够训练出同时具备接近真实数据训练模型的效用与公平性特征的模型。
引用
@article{arxiv.2310.19250,
title = {Assessment of Differentially Private Synthetic Data for Utility and Fairness in End-to-End Machine Learning Pipelines for Tabular Data},
author = {Mayana Pereira and Meghana Kshirsagar and Sumit Mukherjee and Rahul Dodhia and Juan Lavista Ferres and Rafael de Sousa},
journal= {arXiv preprint arXiv:2310.19250},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2106.10241