面向分类与特征选择方法的困难数据集实验识别及方法选择洞见
机器学习
2018-11-26 v2
摘要
本文报告了一个通过实验识别的基准数据集列表,这些数据集对于代表性的分类和特征选择方法而言是困难的。这是在系统性地评估了总共 48 种方法组合之后完成的,这些组合涉及八种最先进的分类算法和六种常用的特征选择方法,并在来自 UCI 仓库的 129 个数据集上进行了测试(排除了部分已知分类准确率很高的数据集)。在本文中,如果一个分类数据集在 48 种组合中无一能达到 0.8 以上的 AUC 值,且无一能达到 0.8 以上的 F-Measure 值,则称其为困难数据集;否则称其为简单数据集。在 129 个数据集中,共发现 15 个数据集在此意义上是困难的。本文还比较了不同方法的性能,并分别针对困难数据集和简单数据集给出了分类方法的排名。本文是首个分别对困难数据集和简单数据集进行方法排名的工作。结果表明,我们实验得出的分类器排名与文献中的排名有所不同,因此为方法选择提供了新的洞见。值得注意的是,随机森林方法在所有实验组中仍然是最优的。
引用
@article{arxiv.1703.08283,
title = {Experimental Identification of Hard Data Sets for Classification and Feature Selection Methods with Insights on Method Selection},
author = {Cuiju Luan and Guozhu Dong},
journal= {arXiv preprint arXiv:1703.08283},
year = {2018}
}
备注
18 pages, 3 figures, 12 tables