中文

差分隐私非交互式K均值聚类的最优网格数

密码学与安全 2026-03-31 v1 机器学习 信号处理 机器学习

摘要

差分隐私K均值聚类能够在保护个体隐私的同时发布从数据集中导出的聚类中心。基于私有化直方图的非交互式聚类技术具有吸引力,因为发布的数据概要可复用于其他下游任务而无需额外的隐私损失。用于离散化数据点的网格数量的选择至关重要,因为它直接控制量化偏差和为保护隐私而注入的噪声量。广泛采用的策略选择与聚类数量无关的网格规模,并依赖经验调参。在本工作中,我们重新审视了这一选择,并通过最小化K均值目标函数的期望偏差上界提出了精细的网格规模选择规则,从而为非交互式私有聚类提供了更原则性的离散化策略。与先前工作相比,我们的网格分辨率在聚类数量依赖性以及随数据集规模和隐私预算的缩放方面均有所不同。大量数值结果阐明,即使在严格的隐私预算下,所提出的策略也能实现与最先进技术的准确聚类。

关键词

引用

@article{arxiv.2603.26963,
  title  = {On the Optimal Number of Grids for Differentially Private Non-Interactive $K$-Means Clustering},
  author = {Gokularam Muthukrishnan and Anshoo Tandon},
  journal= {arXiv preprint arXiv:2603.26963},
  year   = {2026}
}