大数据分析:R、Python 与 Spark 的三个用例
应用统计
2016-10-03 v1 机器学习
摘要
大数据的管理与分析系统性地与 Hadoop 及现今 Spark 框架中的数据分布式架构相关联。本文通过比较直接使用三种参考环境(R、Python Scikit-learn、Spark MLlib)在三个公开用例(字符识别、电影推荐、产品分类)上的性能,为统计学家介绍了这些技术。主要结果表明,尽管 Spark 在数据整理和基于协同过滤(非负因子分解)的推荐方面非常高效,但 MLlib 或 SparkML 中常规学习方法(逻辑回归、随机森林)的当前实现,在集成或非分布式架构中,无法与这些方法(R、Python Scikit-learn)的常规使用相竞争或竞争力很弱。
引用
@article{arxiv.1609.09619,
title = {Big Data analytics. Three use cases with R, Python and Spark},
author = {Philippe Besse and Brendan Guillouet and Jean-Michel Loubes},
journal= {arXiv preprint arXiv:1609.09619},
year = {2016}
}
备注
in French, Apprentissage Statistique et Donn{\'e}es Massives, Technip, 2017, Journ{\'e}es d'Etudes en Statistisque