中文

一种基于次模性的隐私漏斗凝聚聚类算法

信息论 2019-02-14 v2 math.IT

摘要

针对隐私漏斗(PF)问题,我们提出了一种基于次模函数差值最小化的高效迭代凝聚聚类算法(IAC-MDSF)。对于希望共享与敏感信息 SS 相关的数据 XX 的数据管理者而言,PF 问题旨在生成经过脱敏处理的数据 X^\hat{X},使其在维持 I(X;X^)I(X; \hat{X}) 上的特定效用/保真度阈值的同时,最小化隐私泄露 I(S;X^)I(S; \hat{X})。我们的 IAC-MDSF 算法从原始字母表 X^:=X\hat{\mathcal{X}} := \mathcal{X} 开始,迭代地合并当前字母表 X^\hat{\mathcal{X}} 中使拉格朗日函数 I(S;X^)λI(X;X^)I(S;\hat{X}) - \lambda I(X;\hat{X}) 最小化的元素。我们证明,利用现有的 MDSF 算法,可以在 X^\hat{\mathcal{X}} 的所有子集上高效搜索 IAC-MDSF 每次迭代中的最佳合并。我们表明,IAC-MDSF 算法同样适用于 PF 的对偶问题——信息瓶颈(IB)。通过改变拉格朗日乘子 λ\lambda 的值,我们在心脏病数据集上获得了关于帕累托前沿的实验结果:I(S;X^)I(S;\hat{X}) vs. I(X;X^)- I(X;\hat{X})。我们证明,无论是在 PF 还是 IB 问题中,IAC-MDSF 算法均优于现有的迭代成对合并方法,且计算复杂度大幅降低。

关键词

引用

@article{arxiv.1901.06629,
  title  = {A Submodularity-based Agglomerative Clustering Algorithm for the Privacy Funnel},
  author = {Ni Ding and Parastoo Sadeghi},
  journal= {arXiv preprint arXiv:1901.06629},
  year   = {2019}
}

备注

6 pages, 4 figures