中文

面向大数据基于 Apache Spark 的可扩展流形学习

分布式、并行与集群计算 2018-09-03 v1 机器学习

摘要

非线性谱降维方法(如 Isomap)仍是学习流形的重要技术。然而,由于计算复杂度,使用 Isomap 从大规模数据进行精确流形学习目前是不可能的。本文提出一个分布式内存框架,在 Apache Spark 模型下实现端到端精确 Isomap。我们展示了 Isomap 算法的每个关键步骤如何能够利用基础 Spark 模型高效实现,而无需在二级存储中预备数据。我们展示了如何借助 PySpark 实现整个方法,将计算密集的线性代数例程卸载至 BLAS。通过实验结果,我们证明了本方法优异的可扩展性,并表明使用 25 节点并行集群,其可处理的数据集规模比当前可行的大数个数量级。

关键词

引用

@article{arxiv.1808.10776,
  title  = {Scalable Manifold Learning for Big Data with Apache Spark},
  author = {Frank Schoeneman and Jaroslaw Zola},
  journal= {arXiv preprint arXiv:1808.10776},
  year   = {2018}
}