中文

用于隐私数据发布的因果约束数据合成

机器学习 2021-05-28 v1 密码学与安全

摘要

基于证据进行决策需要数据。然而对于实际应用,数据的隐私性至关重要。使用反映原始数据某些统计特性的合成数据可保护原始数据的隐私。为此,先前工作利用差分隐私数据发布机制来提供形式化的隐私保证。然而,此类机制具有不可接受的隐私-效用权衡。我们提出将因果信息纳入训练过程,以有利地改变上述权衡。我们从理论上证明,利用额外因果知识训练的 generative 模型提供更强的差分隐私保证。在经验上,我们基于变分自编码器(VAEs)评估了不同模型的解决方案,并表明因果信息提升了对成员推断的抵御能力,同时改善了下游效用。

关键词

引用

@article{arxiv.2105.13144,
  title  = {Causally Constrained Data Synthesis for Private Data Release},
  author = {Varun Chandrasekaran and Darren Edge and Somesh Jha and Amit Sharma and Cheng Zhang and Shruti Tople},
  journal= {arXiv preprint arXiv:2105.13144},
  year   = {2021}
}