中文

在高维大数据上求解 $k$-means

数据结构与算法 2015-06-01 v3

摘要

近年来,人们主要努力开发数据流算法,这些算法一遍遍历数据且内存需求小。对于 kk-means 问题,这导致了若干 (1+ε)(1+\varepsilon)-近似(在 kk 为常数的假设下)的开发,同时也设计了实践中极快且计算高准确度解的算法。然而,当不仅流的长度很大,而且输入点的维度也很高时,现有方法达到其极限。我们提出两种算法 piecy 和 piecy-mr,它们基于最近开发的数据流算法 BICO,能够一遍处理高维数据并输出高质量解。piecy 适用于具有中等数量点的高维数据,而 piecy-mr 旨在处理以非常长流形式出现的高维数据。我们提供了广泛的实验研究来评估 piecy 和 piecy-mr,显示了新算法的优势。

关键词

引用

@article{arxiv.1502.04265,
  title  = {Solving $k$-means on High-dimensional Big Data},
  author = {Jan-Philipp W. Kappmeier and Daniel R. Schmidt and Melanie Schmidt},
  journal= {arXiv preprint arXiv:1502.04265},
  year   = {2015}
}

备注

23 pages, 9 figures, published at the 14th International Symposium on Experimental Algorithms - SEA 2015