中文

差分隐私查询学习:从数据发布到模型发布

密码学与安全 2017-10-17 v1

摘要

随着大数据与云数据共享的发展,隐私保护数据发布成为过去十年最重要的话题之一。作为最具影响力的隐私定义之一,差分隐私为数据发布提供了严格且可证明的隐私保障。差分隐私交互式发布在许多应用中取得了良好性能;然而,在大数据时代,数据管理者不得不批量发布大量查询或一个合成数据集。为了在差分隐私约束下提供准确的非交互式发布结果,需要应对两个挑战:一是如何降低大量查询集之间的相关性,二是如何对全新查询进行预测。传统差分隐私机制均不易解决这两者。本文将数据发布问题转化为一个机器学习问题,其中查询被视为训练样本,并将发布一个预测模型而非查询结果或合成数据集。当模型发布后,它可用于回答当前提交的查询并预测来自公众的新查询的结果。与传统方法相比,所提出的预测模型提升了非交互式发布的查询结果的准确性。实验结果表明,所提方案在大量查询上的平均绝对値(Mean Absolute Value)方面优于传统差分隐私。这也表明该学习模型能在保护隐私的同时成功保留已发布查询的效用。

关键词

引用

@article{arxiv.1710.05095,
  title  = {Differentially Private Query Learning: from Data Publishing to Model Publishing},
  author = {Tianqing Zhu and Ping Xiong and Gang Li and Wanlei Zhou and Philip S. Yu},
  journal= {arXiv preprint arXiv:1710.05095},
  year   = {2017}
}