中文

层次聚类差分隐私的价格

数据结构与算法 2025-04-23 v1 密码学与安全 机器学习

摘要

层次聚类是一种基本的无监督机器学习任务,旨在将数据组织成层次化的聚类。许多层次聚类的应用涉及敏感用户信息,因此激励最近在达斯古拉的目标下对层次聚类进行差分隐私研究。然而,已证明在边缘级差分隐私下,任何保护隐私的算法都必然 suffer 较大的误差。为捕捉此问题的实际应用,我们关注权重隐私模型,其中输入图的每条边至少具有单位权重。我们提出了一种针对权重隐私模型的新型算法,显示出显著优于边缘级 DP 设置中已知的不可能结果。具体而言,我们的算法在 ε\varepsilon-DP 下实现 O(log1.5n/ε)O(\log^{1.5}n/\varepsilon) 的乘法误差,运行时间为多项式时间,其中 nn 为输入图的大小,且成本永远不会比现有工作中已知的最优加法误差差。我们补充说明,如果不适用单位权重约束,则权重级 DP 层次聚类的下界本质上与边缘级 DP 相同,即 Ω(n2/ε)\Omega(n^2/\varepsilon) 的加法误差。作为结果,我们还获得了权重级 DP 模型中均衡稀疏割的新的下界 Ω~(1/ε)\tilde{\Omega}(1/\varepsilon) 的加法误差,可能独有兴趣。最后,我们在合成数据和真实数据集上评估了该算法。我们的实验结果表明,该算法在额外成本和大规模图的可扩展性方面表现良好。

关键词

引用

@article{arxiv.2504.15580,
  title  = {On the Price of Differential Privacy for Hierarchical Clustering},
  author = {Chengyuan Deng and Jie Gao and Jalaj Upadhyay and Chen Wang and Samson Zhou},
  journal= {arXiv preprint arXiv:2504.15580},
  year   = {2025}
}

备注

ICLR 2025