Apache Spark 下的大数据信息论特征选择框架
人工智能
2016-10-20 v2 分布式、并行与集群计算
机器学习
摘要
随着极高维数据集的出现,降维技术正变得不可或缺。在众多技术中,特征选择作为一种在实例数和特征数均巨大的数据集上识别相关特征的重要工具,其关注度日益增长。本工作的目的是证明标准特征选择方法可以在 Apache Spark 等大数据平台上并行化,从而同时提升性能和准确率。因此,我们提出了一个通用特征选择框架的分布式实现,该框架涵盖了一组广泛且知名的信息论方法。在大量真实世界数据集上的实验结果表明,我们的分布式框架能够在短时间内处理超高维数据集以及具有海量样本的数据集,在所有研究案例中均优于串行版本。
引用
@article{arxiv.1610.04154,
title = {An Information Theoretic Feature Selection Framework for Big Data under Apache Spark},
author = {Sergio Ramírez-Gallego and Héctor Mouriño-Talín and David Martínez-Rego and Verónica Bolón-Canedo and José Manuel Benítez and Amparo Alonso-Betanzos and Francisco Herrera},
journal= {arXiv preprint arXiv:1610.04154},
year = {2016}
}