机器学习变换数据上异常子组的保持
机器学习
2019-11-12 v1 密码学与安全
机器学习
摘要
在本文中,我们研究基于机器学习的匿名化对异常子组保持的影响。具体而言,我们训练一个二分类器,通过最大化该组模型预测比值比与数据观测比值比之间的偏差,来发现数据集中最异常的子组。随后我们使用变分自编码器 (VAE) 执行匿名化,以合成一个理想情况下从原始数据分布中抽取的全新数据集。我们在新数据上重复异常子组发现任务,并将其与匿名化前识别的结果进行比较。我们使用来自金融行业的公开可用数据集评估了我们的方法。我们的评估证实,该方法能够生成保持原始数据集中最初识别出的高度子组差异性的合成数据集。这种差异性在合成数据集与原始数据集记录明显不同的情况下得以维持。最后,我们将上述端到端流程打包为我们称之为效用保证深度隐私 (UGDP) 的系统。UGDP 可轻松扩展以接入替代生成方法(如 GAN)来合成表格数据。
引用
@article{arxiv.1911.03674,
title = {Preservation of Anomalous Subgroups On Machine Learning Transformed Data},
author = {Samuel C. Maina and Reginald E. Bryant and William O. Goal and Robert-Florian Samoilescu and Kush R. Varshney and Komminist Weldemariam},
journal= {arXiv preprint arXiv:1911.03674},
year = {2019}
}
备注
5 pages, 3 figures, 2 tables, submitted to icassp 2019