面向最优预测性机器学习与数据挖掘的大数据分类法
机器学习
2015-01-06 v1
摘要
大数据以各种方式、类型、形状、形式和规模出现。事实上,几乎科学、技术、医学、公共卫生、经济、商业、语言学和社交科学的所有领域都受到日益增长且亟待高效分析的数据流的冲击。本文中,我们提出一种可能的大数据分类法的粗略想法,以及用于处理每一特定庞大类别的一些最常用工具。输入空间的维数 与样本量 通常是刻画数据庞大性的主要要素。用于处理特定大数据集的特定统计机器学习技术将取决于它在该庞大性分类法中落入哪一类别。例如大 小 数据集需要不同于大 小 类型的工具集。在其他工具中,我们讨论预处理、标准化、插补、投影、正则化、惩罚、压缩、降维、选择、核化、杂交、并行化、聚合、随机化、复制、序列化。确实,立即强调所谓的无免费午餐定理在此适用十分重要,即在所有庞大性类别上没有任何普遍优越的方法能胜过所有其他方法。同样重要的是强调奥卡姆剃刀的简约非复多原则意义上的简单性在海量数据前往往至高无上。我们以在一些数据集上比较若干最常用方法的预测性能作结。
引用
@article{arxiv.1501.00604,
title = {A Taxonomy of Big Data for Optimal Predictive Machine Learning and Data Mining},
author = {Ernest Fokoue},
journal= {arXiv preprint arXiv:1501.00604},
year = {2015}
}
备注
18 pages, 2 figures 3 tables