面向高噪声数据的分布式 $k$-聚类
分布式、并行与集群计算
2018-11-30 v2 数据结构与算法
机器学习
摘要
本文考虑分布式环境下的带离群点 -中心/中值/均值聚类问题(或称 -中心/中值/均值问题)。以往大多数分布式算法的通信代价线性依赖于 (离群点数量)。最近 Guha 等人通过考虑输出含 个离群点解的双向准则近似算法克服了该依赖问题。对于 较大的情形,算法丢弃的额外 个离群点可能过多,考虑到数据收集过程可能代价高昂。本文将离群点数量改进为最优可能的 ,同时保持 -近似比以及通信代价对 的无关性。我们考虑的问题包括 -中心问题,以及欧氏度量下的 -中值/均值问题。针对 -中心的算法实现表明,其在通信代价和输出解质量方面均优于许多先前算法。
引用
@article{arxiv.1810.07852,
title = {Distributed $k$-Clustering for Data with Heavy Noise},
author = {Xiangyu Guo and Shi Li},
journal= {arXiv preprint arXiv:1810.07852},
year = {2018}
}
备注
slightly improve the comm cost over the version accepted into NeurIPS'18