分布式数据中心聚类的统一框架
机器学习
2024-11-26 v2 分布式、并行与集群计算
多智能体系统
摘要
我们开发了一系列在用户网络上工作的分布式中心聚类算法。在所提出的场景中,用户包含一个本地数据集,并且只与他们的直接邻居通信,其目标是找到完整联合数据的聚类。所提出的算法族,称为分布式梯度聚类(DGC-),由 参数化,控制用户中心估计的接近程度,而 决定了聚类损失。我们的框架允许一大类平滑凸损失函数,包括流行的聚类损失,如 -means 和 Huber 损失。针对流行的聚类损失如 -means 和 Huber 损失,DGC- 衍生出新颖的分布式聚类算法 DGC-KM 和 DGC-HL,而基于 Logistic 和 Fair 函数的新颖聚类损失则导致了 DGC-LL 和 DGC-FL。我们提供了一个统一的分析,并在温和的假设下建立了几个强有力的结果。首先,我们证明了在任何中心初始化和 值下,由这些方法生成的中心序列都收敛到一个明确定义的不动点概念。其次,我们证明了,随着 的增加,DGC- 产生的不动点族收敛到一个共识不动点概念。我们证明 DGC- 的共识不动点等价于全数据上梯度聚类的不动点,从而保证了产生全数据的聚类。对于 Bregman 损失的特殊情况,我们证明了我们的不动点收敛到 Lloyd 点集。在合成数据和真实数据上的大量数值实验证实了我们的理论发现,展示了我们方法的强大性能,并证明了我们通用框架的实用性和广泛的应用潜力,例如异常值检测。
引用
@article{arxiv.2402.01302,
title = {A Unified Framework for Center-based Clustering of Distributed Data},
author = {Aleksandar Armacki and Dragana Bajović and Dušan Jakovetić and Soummya Kar},
journal= {arXiv preprint arXiv:2402.01302},
year = {2024}
}
备注
49 pages, 9 figures, 7 tables