近似、适配、匿名化(3A):一种用于机器学习隐私保护训练数据发布的框架
机器学习
2023-07-06 v1 密码学与安全
摘要
大量信息数据的可用性对机器学习的成功至关重要。然而,在包含敏感信息的领域中,发布保护个人隐私且高可用性的数据已被证明颇具挑战。尽管文献中在差分隐私和用于隐私保护数据发布的生成建模方面取得了进展,但仅有少数方法针对机器学习效用进行优化:大多数方法仅考虑数据本身的统计度量,未能显式保留随后在生成数据上训练的机器学习模型的损失度量。本文中,我们引入一种数据发布框架 3A(Approximate, Adapt, Anonymize,近似、适配、匿名化),以在保留差分隐私的同时最大化机器学习的数据效用。我们还描述了该框架的一种具体实现,其利用混合模型进行近似、核诱导点进行适配、高斯差分隐私进行匿名化,以确保所得数据既隐私保护又高效用。我们给出的实验证据表明,在留出真实数据上评估时,在真实数据集与隐私化数据集上训练的模型性能度量间差异极小。我们还将结果与若干隐私保护合成数据生成模型(如差分隐私生成对抗网络)比较,并报告分类性能度量相较最先进模型显著提升。这些有利的对比表明,所提框架是一个有前景的研究方向,提升了低风险合成数据发布用于机器学习的效用。
引用
@article{arxiv.2307.01875,
title = {Approximate, Adapt, Anonymize (3A): a Framework for Privacy Preserving Training Data Release for Machine Learning},
author = {Tamas Madl and Weijie Xu and Olivia Choudhury and Matthew Howard},
journal= {arXiv preprint arXiv:2307.01875},
year = {2023}
}
备注
10 pages, 3 figures, AAAI Workshop