面向大数据基于 Apache Spark 的可扩展流形学习
分布式、并行与集群计算
2018-09-03 v1 机器学习
摘要
非线性谱降维方法(如 Isomap)仍是学习流形的重要技术。然而,由于计算复杂度,使用 Isomap 从大规模数据进行精确流形学习目前是不可能的。本文提出一个分布式内存框架,在 Apache Spark 模型下实现端到端精确 Isomap。我们展示了 Isomap 算法的每个关键步骤如何能够利用基础 Spark 模型高效实现,而无需在二级存储中预备数据。我们展示了如何借助 PySpark 实现整个方法,将计算密集的线性代数例程卸载至 BLAS。通过实验结果,我们证明了本方法优异的可扩展性,并表明使用 25 节点并行集群,其可处理的数据集规模比当前可行的大数个数量级。
引用
@article{arxiv.1808.10776,
title = {Scalable Manifold Learning for Big Data with Apache Spark},
author = {Frank Schoeneman and Jaroslaw Zola},
journal= {arXiv preprint arXiv:1808.10776},
year = {2018}
}