中文

k-Means 子聚类:一种具有改进聚类质量的差分私有算法

机器学习 2023-01-10 v1

摘要

在当今数据驱动的世界中,信息的敏感性一直是重要关切。利用这些数据及个人背景的附加信息,可轻易推断个体的隐私数据。交互式设定中已提出许多差分私有迭代算法,以保护个体免受这些推断攻击。现有方法调整以迭代 Lloyd 算法计算差分私有(DP)质心并通过各种 DP 机制扰动质心。这些 DP 机制不保证差分私有迭代算法的收敛并降低聚类质量。因此,本工作中我们进一步扩展先前“具收敛保证的差分私有 k-Means 聚类”的工作,将其作为基线。我们方法的新颖之处在于对聚类进行子聚类,然后选择更可能朝未来质心方向移动的质心。在每步 Lloyd 中,使用指数 DP 机制向质心注入噪声。实验结果表明,我们的方法在保持相同差分私有要求下,聚类质量优于当前最先进方法即基线算法。对于 Wine 与 Breast_Cancer 数据集,聚类质量分别比基线显著提高了 4.13 与 2.83 倍。

关键词

引用

@article{arxiv.2301.02896,
  title  = {k-Means SubClustering: A Differentially Private Algorithm with Improved Clustering Quality},
  author = {Devvrat Joshi and Janvi Thakkar},
  journal= {arXiv preprint arXiv:2301.02896},
  year   = {2023}
}

备注

Accepted at PAS Workshop at CIKM 2022