中文

基于快速相似度匹配的流式数据主子空间高效投影

统计计算 2018-08-08 v1 机器学习

摘要

大数据问题经常需要以流式方式处理数据集,要么是因为所有数据同时可用但总体规模超出可用内存,要么是因为数据本质上逐个到达且必须在线处理。在此,我们介绍了一种计算高效的相似度匹配方法,这是一种在线降维框架,可在仅保留最后一个样本和当前迭代值于内存中的情况下,增量估计流式数据的前 K 维主子空间。为评估我们方法的性能,我们构建并公开了一个测试套件,其中包含合成数据生成器以及在真实数据集上测试在线降维算法的基础设施,以及我们算法和具有类似目标的其他竞争算法的高效实现。在所考虑的算法中,我们发现我们的方法具有竞争力,在合成数据和真实数据上均表现优异。

关键词

引用

@article{arxiv.1808.02083,
  title  = {Efficient Principal Subspace Projection of Streaming Data Through Fast Similarity Matching},
  author = {Andrea Giovannucci and Victor Minden and Cengiz Pehlevan and Dmitri B. Chklovskii},
  journal= {arXiv preprint arXiv:1808.02083},
  year   = {2018}
}

备注

9 pages, 4 figures