伪造特征重要性:关于使用差分隐私合成数据的一个警示故事
机器学习
2022-03-04 v1 应用统计
摘要
合成数据集常被作为隐私保护数据发布的灵丹妙药。然而,对于许多应用,当用于训练预测模型时,合成数据已被证明效用有限。这些数据一个大有前景的潜在应用是在机器学习工作流的探索阶段,该阶段涉及理解、构造与选择特征。此阶段常耗费大量时间,并依赖于数据的可获取性。若合成数据能允许在这些步骤进行的同时(例如正在协商数据访问权限时,或在更少的信息治理限制下)完成,将具有重大价值。本文对一系列人工生成与真实世界数据集上从原始数据与合成数据所得特征重要性之间的一致性进行了实证分析(其中特征重要性表示各特征在预测结果时的有用程度)。我们采用两种差分隐私方法生成合成数据,并应用多种效用度量来量化特征重要性随隐私水平变化的一致性。我们的结果表明,合成数据在简单设定下有时能保留特征重要性排序的若干表示,但其表现并不稳定且取决于若干因素。在更微妙的真实世界设定中尤须谨慎,合成数据可能导致排序特征重要性的差异,从而改变关键的建模决策。本工作对金融与医疗等领域高度敏感数据集的合成版本开发具有重要启示。
引用
@article{arxiv.2203.01363,
title = {Faking feature importance: A cautionary tale on the use of differentially-private synthetic data},
author = {Oscar Giles and Kasra Hosseini and Grigorios Mingas and Oliver Strickson and Louise Bowler and Camila Rangel Smith and Harrison Wilde and Jen Ning Lim and Bilal Mateen and Kasun Amarasinghe and Rayid Ghani and Alison Heppenstall and Nik Lomax and Nick Malleson and Martin O'Reilly and Sebastian Vollmerteke},
journal= {arXiv preprint arXiv:2203.01363},
year = {2022}
}
备注
27 pages, 8 figures