基于 k-means 聚类的有效且稀疏的 Count-Sketch
机器学习
2020-11-30 v2
摘要
Count-sketch 是一种流行的矩阵草图算法,可以在 O(nnz(X)) 时间内产生输入数据矩阵 X 的草图,其中 nnz(X) 表示 X 中非零项的数量。草图矩阵将远小于 X,同时保留其大部分性质。因此,count-sketch 被广泛用于解决机器学习中的高维挑战。然而,count-sketch 有两个主要局限:(1)count-sketch 使用的草图矩阵是随机生成的,未考虑 X 的任何内在数据性质。这种数据无关矩阵草图方法可能产生糟糕的草图矩阵,导致后续机器学习任务(例如分类)精度低;(2)对于高度稀疏的输入数据,count-sketch 可能产生稠密草图数据矩阵。该稠密草图矩阵可能使后续机器学习任务比在原始稀疏数据 X 上计算开销更大。为解决这两个局限,我们首先通过分析 count-sketch 方法的重构误差,展示了 count-sketch 与 k-means 聚类之间的有趣联系。基于我们的分析,我们提出通过使用 k-means 聚类算法获得低维草图矩阵来减少 count-sketch 的重构误差。此外,我们提出使用带 -L1 球投影的梯度下降求解 k-means 聚类以产生稀疏草图矩阵。基于六个真实分类数据集的实验结果表明,我们提出的方法比原始 count-sketch 和其他流行矩阵草图算法达到更高精度。我们的结果还表明,我们的方法产生的草图数据矩阵比其他方法更稀疏,因此我们的方法的预测开销将小于其他矩阵草图方法。
关键词
引用
@article{arxiv.2011.12046,
title = {Effective and Sparse Count-Sketch via k-means clustering},
author = {Yuhan Wang and Zijian Lei and Liang Lan},
journal= {arXiv preprint arXiv:2011.12046},
year = {2020}
}
备注
8 pages, 8 figures