中文

使用核心集对大规模稀疏数据集进行降维

数据结构与算法 2015-03-06 v1

摘要

在本文中,我们针对大规模稀疏矩阵的降维问题提出了一种具有性能保证的实用解决方案。我们展示了该方法在计算此类矩阵的低秩近似(截断 SVD)中的应用。我们的解决方案使用核心集(coresets),即从 n×dn\times d 输入矩阵中选取的 O(k/\eps2)O(k/\eps^2) 个缩放行的子集,该子集近似于其行到 \REALd\REAL^d 中每个 kk 维子空间的平方距离之和,误差因子为 1±\eps1\pm\eps。一个开放的理论问题是:我们能否计算出一个独立于输入矩阵且为其行的加权子集的核心集?我们对此给出了肯定的回答。我们的主要技术结果是一种新颖的确定性核心集构造技术,其基于归约为项频率的 2\ell_2 近似问题。

关键词

引用

@article{arxiv.1503.01663,
  title  = {Dimensionality Reduction of Massive Sparse Datasets Using Coresets},
  author = {Dan Feldman and Mikhail Volkov and Daniela Rus},
  journal= {arXiv preprint arXiv:1503.01663},
  year   = {2015}
}