在高维大数据上求解 $k$-means
数据结构与算法
2015-06-01 v3
摘要
近年来,人们主要努力开发数据流算法,这些算法一遍遍历数据且内存需求小。对于 -means 问题,这导致了若干 -近似(在 为常数的假设下)的开发,同时也设计了实践中极快且计算高准确度解的算法。然而,当不仅流的长度很大,而且输入点的维度也很高时,现有方法达到其极限。我们提出两种算法 piecy 和 piecy-mr,它们基于最近开发的数据流算法 BICO,能够一遍处理高维数据并输出高质量解。piecy 适用于具有中等数量点的高维数据,而 piecy-mr 旨在处理以非常长流形式出现的高维数据。我们提供了广泛的实验研究来评估 piecy 和 piecy-mr,显示了新算法的优势。
引用
@article{arxiv.1502.04265,
title = {Solving $k$-means on High-dimensional Big Data},
author = {Jan-Philipp W. Kappmeier and Daniel R. Schmidt and Melanie Schmidt},
journal= {arXiv preprint arXiv:1502.04265},
year = {2015}
}
备注
23 pages, 9 figures, published at the 14th International Symposium on Experimental Algorithms - SEA 2015