中文

用于分类的多属性数据差分隐私投影直方图

密码学与安全 2015-04-24 v1

摘要

本文致力于解决为分类分析构建差分隐私概要的问题。若干最先进的方法遵循现有分类算法的结构且均为迭代式,由于局部最优选择以及过多顺序组合步骤间隐私预算的过度划分,这是次优的。相反,我们提出一种新方法 PrivPfC,一种用于发布分类数据的新型差分隐私方法。其核心思想是利用给定隐私预算一步私有地选择底层数据集的最优划分。给定数据集与隐私预算,PrivPfC 构建候选网格池,其中每个网格的单元数低于数据感知与隐私预算感知的阈值。此后,PrivPfC 通过指数机制使用一种新颖的质量函数选择最优网格,该函数最小化基于发布网格构建直方图分类器时的期望误分类记录数。最后,PrivPfC 向所选网格的每个单元注入噪声,并发布该噪声网格作为数据的私有概要。若候选网格池规模大于数据管理者设定的处理能力阈值,我们在 PrivPfC 开头增加一步以私有地剪枝属性集。我们引入具有低灵敏度的修正 χ2\chi^2 质量函数,并用其评估属性与分类标签变量的相关性。通过在真实数据集上的大量实验,我们展示了 PrivPfC 相对于最先进方法的优越性。

关键词

引用

@article{arxiv.1504.05997,
  title  = {Differentially Private Projected Histograms of Multi-Attribute Data for Classification},
  author = {Dong Su and Jianneng Cao and Ninghui Li},
  journal= {arXiv preprint arXiv:1504.05997},
  year   = {2015}
}