中文

“优于随机”的投影:如何以超越随机投影的方式降低超大数据集的维度

机器学习 2019-01-04 v1 机器学习

摘要

对于超大数据集,随机投影(RP)已成为降维的首选工具。这是由于主成分分析的计算复杂性。然而,随机化主成分分析(RPCA)的最近发展开启了在超大数据集上获得近似主成分的可能性。在本文中,我们比较了 RPCA 和 RP 在有监督学习降维中的性能。在实验 1 中,我们研究一个包含超过 1000 万样本、近 100,000 个特征以及超过 250 亿个非零值的数据集上的恶意软件分类任务,目标是将维度降至 5,000 个特征的压缩表示。为将该数据集应用于 RPCA,我们开发了一种称为大样本 RPCA(LS-RPCA)的新算法,它将 RPCA 算法扩展至可处理任意多样本的数据集。我们发现,使用 LS-RPCA 进行降维时的分类性能远高于使用随机投影。具体而言,在一系列目标维度下,我们发现使用 LS-RPCA 将分类误差降低了 37% 至 54%。实验 2 将该现象推广到多个数据集、特征表示和分类器。这些发现对大量以随机投影作为降维预处理步骤的研究项目具有启示意义。只要精度至关重要且目标维度充分小于数据集的数值秩,随机化 PCA 可能是更优选择。此外,若数据集具有大量样本,则 LS-RPCA 将提供一种获得近似主成分的方法。

关键词

引用

@article{arxiv.1901.00630,
  title  = {Projecting "better than randomly": How to reduce the dimensionality of very large datasets in a way that outperforms random projections},
  author = {Michael Wojnowicz and Di Zhang and Glenn Chisholm and Xuan Zhao and Matt Wolff},
  journal= {arXiv preprint arXiv:1901.00630},
  year   = {2019}
}

备注

Originally published in IEEE DSAA in 2016; this post-print fixes a rendering error of the += operator in Algorithm 3