一种基于次模性的隐私漏斗凝聚聚类算法
信息论
2019-02-14 v2 math.IT
摘要
针对隐私漏斗(PF)问题,我们提出了一种基于次模函数差值最小化的高效迭代凝聚聚类算法(IAC-MDSF)。对于希望共享与敏感信息 相关的数据 的数据管理者而言,PF 问题旨在生成经过脱敏处理的数据 ,使其在维持 上的特定效用/保真度阈值的同时,最小化隐私泄露 。我们的 IAC-MDSF 算法从原始字母表 开始,迭代地合并当前字母表 中使拉格朗日函数 最小化的元素。我们证明,利用现有的 MDSF 算法,可以在 的所有子集上高效搜索 IAC-MDSF 每次迭代中的最佳合并。我们表明,IAC-MDSF 算法同样适用于 PF 的对偶问题——信息瓶颈(IB)。通过改变拉格朗日乘子 的值,我们在心脏病数据集上获得了关于帕累托前沿的实验结果: vs. 。我们证明,无论是在 PF 还是 IB 问题中,IAC-MDSF 算法均优于现有的迭代成对合并方法,且计算复杂度大幅降低。
引用
@article{arxiv.1901.06629,
title = {A Submodularity-based Agglomerative Clustering Algorithm for the Privacy Funnel},
author = {Ni Ding and Parastoo Sadeghi},
journal= {arXiv preprint arXiv:1901.06629},
year = {2019}
}
备注
6 pages, 4 figures