基于深度生成模型的差分隐私发布(技术报告)
密码学与安全
2018-03-28 v2 机器学习
摘要
复杂数据(如图像、文本、音频)的隐私保护发布是数据挖掘研究领域长期存在的挑战。由于数据语义丰富且缺乏对分析任务的先验知识,为确保隐私往往需要进行过度清洗,导致数据效用的显著损失。本文提出dp-GAN,一个面向语义丰富数据的通用隐私发布框架。数据管理者不再清洗并发布数据,而是发布一个以差分隐私方式使用原始数据训练的深度生成模型;借助该生成模型,分析者能够为任意分析任务生成无限量的合成数据。相较替代方案,dp-GAN突出一组关键特性:(i) 通过施行差分隐私原则提供理论隐私保证;(ii) 在发布的模型中保留合意效用,支持多种原本不可能的分析;以及 (iii) 最为重要的是,通过采用多重优化策略实现实用的训练可扩展性与稳定性。通过在基准数据集上的广泛实证评估与分析,我们验证了dp-GAN的有效性。
引用
@article{arxiv.1801.01594,
title = {Differentially Private Releasing via Deep Generative Model (Technical Report)},
author = {Xinyang Zhang and Shouling Ji and Ting Wang},
journal= {arXiv preprint arXiv:1801.01594},
year = {2018}
}