无需簇数先验知识的压缩数据上的分散式聚类
机器学习
2018-07-13 v1 机器学习
摘要
在传感器网络中,建立融合中心并非总是可行的。因此,需要完全分散式的聚类算法。分散式聚类算法应最小化传感器间交换的数据量,以降低传感器能耗。在这方面,我们提出一种集中式与一种分散式聚类算法,它们可在无需簇数先验知识的情况下处理压缩数据。在标准 K-means 聚类算法中,簇数通过多次重复算法来估计,这极大地增加了交换数据量,而我们的算法可在一次运行中估计该数目。所提聚类算法源于一个理论框架,该框架确立在渐近条件下簇质心是我们引入的代价函数的唯一不动点。该代价函数依赖于一个权重函数,我们将其选为 Wald 假设检验的 p 值。该 p 值衡量给定测量向量属于给定簇的可信度。实验结果表明,我们的两种算法在聚类性能上可与 K-means 和 DB-Scan 竞争,同时将传感器间交换的数据量至少降低 倍。
引用
@article{arxiv.1807.04566,
title = {Decentralized Clustering on Compressed Data without Prior Knowledge of the Number of Clusters},
author = {Elsa Dupraz and Dominique Pastor and François-Xavier Socheleau},
journal= {arXiv preprint arXiv:1807.04566},
year = {2018}
}
备注
Submitted to IEEE Transactions on Signal and Information Processing over Networks