中文

面向高噪声数据的分布式 $k$-聚类

分布式、并行与集群计算 2018-11-30 v2 数据结构与算法 机器学习

摘要

本文考虑分布式环境下的带离群点 kk-中心/中值/均值聚类问题(或称 (k,z)(k, z)-中心/中值/均值问题)。以往大多数分布式算法的通信代价线性依赖于 zz(离群点数量)。最近 Guha 等人通过考虑输出含 2z2z 个离群点解的双向准则近似算法克服了该依赖问题。对于 zz 较大的情形,算法丢弃的额外 zz 个离群点可能过多,考虑到数据收集过程可能代价高昂。本文将离群点数量改进为最优可能的 (1+ϵ)z(1+\epsilon)z,同时保持 O(1)O(1)-近似比以及通信代价对 zz 的无关性。我们考虑的问题包括 (k,z)(k, z)-中心问题,以及欧氏度量下的 (k,z)(k, z)-中值/均值问题。针对 (k,z)(k, z)-中心的算法实现表明,其在通信代价和输出解质量方面均优于许多先前算法。

关键词

引用

@article{arxiv.1810.07852,
  title  = {Distributed $k$-Clustering for Data with Heavy Noise},
  author = {Xiangyu Guo and Shi Li},
  journal= {arXiv preprint arXiv:1810.07852},
  year   = {2018}
}

备注

slightly improve the comm cost over the version accepted into NeurIPS'18