中文

分布式数据中心聚类的统一框架

机器学习 2024-11-26 v2 分布式、并行与集群计算 多智能体系统

摘要

我们开发了一系列在用户网络上工作的分布式中心聚类算法。在所提出的场景中,用户包含一个本地数据集,并且只与他们的直接邻居通信,其目标是找到完整联合数据的聚类。所提出的算法族,称为分布式梯度聚类(DGC-Fρ\mathcal{F}_\rho),由 ρ1\rho \geq 1 参数化,控制用户中心估计的接近程度,而 F\mathcal{F} 决定了聚类损失。我们的框架允许一大类平滑凸损失函数,包括流行的聚类损失,如 KK-means 和 Huber 损失。针对流行的聚类损失如 KK-means 和 Huber 损失,DGC-Fρ\mathcal{F}_\rho 衍生出新颖的分布式聚类算法 DGC-KMρ_\rho 和 DGC-HLρ_\rho,而基于 Logistic 和 Fair 函数的新颖聚类损失则导致了 DGC-LLρ_\rho 和 DGC-FLρ_\rho。我们提供了一个统一的分析,并在温和的假设下建立了几个强有力的结果。首先,我们证明了在任何中心初始化和 ρ\rho 值下,由这些方法生成的中心序列都收敛到一个明确定义的不动点概念。其次,我们证明了,随着 ρ\rho 的增加,DGC-Fρ\mathcal{F}_\rho 产生的不动点族收敛到一个共识不动点概念。我们证明 DGC-Fρ\mathcal{F}_{\rho} 的共识不动点等价于全数据上梯度聚类的不动点,从而保证了产生全数据的聚类。对于 Bregman 损失的特殊情况,我们证明了我们的不动点收敛到 Lloyd 点集。在合成数据和真实数据上的大量数值实验证实了我们的理论发现,展示了我们方法的强大性能,并证明了我们通用框架的实用性和广泛的应用潜力,例如异常值检测。

关键词

引用

@article{arxiv.2402.01302,
  title  = {A Unified Framework for Center-based Clustering of Distributed Data},
  author = {Aleksandar Armacki and Dragana Bajović and Dušan Jakovetić and Soummya Kar},
  journal= {arXiv preprint arXiv:2402.01302},
  year   = {2024}
}

备注

49 pages, 9 figures, 7 tables