大数据的预条件数据稀疏化及其在PCA与K-means中的应用
机器学习
2017-02-24 v3 机器学习
摘要
我们分析了一种针对大型数据集的压缩方案,该方案随机保留每个数据样本的一小部分分量。其好处是输出为一个稀疏矩阵,因此后续处理(如 PCA(主成分分析)或 K-means(K均值))显著加快,尤其在分布式数据环境下。此外,该采样是单遍的,适用于流数据。该采样机制是文献中已有方法的一个变体,并结合了随机预处理以平滑数据。我们针对 PCA 给出了基于协方差矩阵的保证,并针对 K-means 给出了在给定步骤中中心估计器误差的保证。我们给出了数值证据,表明我们的界几乎紧致,且我们的算法在应用于标准测试数据集时带来切实益处,相较相关采样方法也具有一定优势。
引用
@article{arxiv.1511.00152,
title = {Preconditioned Data Sparsification for Big Data with Applications to PCA and K-means},
author = {Farhad Pourkamali-Anaraki and Stephen Becker},
journal= {arXiv preprint arXiv:1511.00152},
year = {2017}
}
备注
28 pages, 10 figures