中文

大数据分析:R、Python 与 Spark 的三个用例

应用统计 2016-10-03 v1 机器学习

摘要

大数据的管理与分析系统性地与 Hadoop 及现今 Spark 框架中的数据分布式架构相关联。本文通过比较直接使用三种参考环境(R、Python Scikit-learn、Spark MLlib)在三个公开用例(字符识别、电影推荐、产品分类)上的性能,为统计学家介绍了这些技术。主要结果表明,尽管 Spark 在数据整理和基于协同过滤(非负因子分解)的推荐方面非常高效,但 MLlib 或 SparkML 中常规学习方法(逻辑回归、随机森林)的当前实现,在集成或非分布式架构中,无法与这些方法(R、Python Scikit-learn)的常规使用相竞争或竞争力很弱。

关键词

引用

@article{arxiv.1609.09619,
  title  = {Big Data analytics. Three use cases with R, Python and Spark},
  author = {Philippe Besse and Brendan Guillouet and Jean-Michel Loubes},
  journal= {arXiv preprint arXiv:1609.09619},
  year   = {2016}
}

备注

in French, Apprentissage Statistique et Donn{\'e}es Massives, Technip, 2017, Journ{\'e}es d'Etudes en Statistisque