中文

协变量偏移下的差分隐私分布式数据摘要

机器学习 2020-01-10 v2 密码学与安全 信息论 math.IT 机器学习

摘要

我们设想AI市场平台为这样的场所:对于目标任务数据极少的消费者,可以通过访问许多具有大量数据样本的私有数据源来获得相关模型。关键挑战之一是在不损害数据源隐私的情况下构建匹配目标任务的数据集。为此,我们考虑如下分布式数据摘要问题。给定K个私有源数据集记为[Di]i[K][D_i]_{i\in [K]}和一个小的目标验证集DvD_v(其可能与源数据集存在显著协变量偏移),计算摘要数据集Dsi[K]DiD_s\subseteq \bigcup_{i\in [K]} D_i使其与验证数据集DvD_v的统计距离最小化。我们使用流行的最大均值差异作为统计距离度量。非私有问题在先前工作中已受到相当关注,例如原型选择(Kim et al., NIPS 2016)。我们的工作是首个在确保非私有版本质量保障的同时获得强差分隐私保障的工作。我们在一个节俭管理者隐私模型(Parsimonious Curator Privacy Model)中研究该问题,其中可信管理者协调摘要过程同时最小化所访问的私有信息量。我们的核心结果是一个新颖协议,其(a)确保管理者至多访问O(K13Ds+Dv)O(K^{\frac{1}{3}}|D_s| + |D_v|)个点,(b)对数据拥有者间信息泄露具有形式化隐私保障,以及(c)紧密匹配已知最佳非私有贪婪算法。我们的协议使用两个哈希函数,一个受Rahimi-Recht随机特征方法启发,第二个利用最先进差分隐私机制。我们引入了一种新颖的“无噪声”差分隐私拍卖协议用于赢者通知,并使用真实世界数据集展示了我们协议的有效性。

关键词

引用

@article{arxiv.1910.12832,
  title  = {Differentially Private Distributed Data Summarization under Covariate Shift},
  author = {Kanthi Sarpatwar and Karthikeyan Shanmugam and Venkata Sitaramagiridharganesh Ganapavarapu and Ashish Jagmohan and Roman Vaculin},
  journal= {arXiv preprint arXiv:1910.12832},
  year   = {2020}
}

备注

To appear in the 33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada