中文

数据还是分类器,谁胜出?

机器学习 2021-11-03 v4

摘要

机器学习(ML)所涵盖的实验必须考虑两个重要方面以评估模型性能:数据集与算法。需要稳健的基准来评估最优分类器。为此,可采用公共存储库中可用的黄金标准基准。然而,在评估时通常未考虑数据集的复杂度。本工作提出一种基于项目反应理论(IRT)与Glicko-2相结合的新型评估方法,后者是一种通常用于评估选手实力(如国际象棋)的评级系统机制。对于基准中的每个数据集,利用IRT估计分类器的能力,其中优良的分类器对最困难的测试样本具有良好预测。随后对每对分类器进行锦标赛式比对,使Glicko-2更新诸如评级值、评级偏差与波动率等性能信息。本文开展了一项案例研究,采用OpenML-CC18基准作为数据集集合及各类待评估分类算法的池。观察到并非所有数据集都真正有益于算法评估,仅10%被认为确实困难。此外,验证存在一个仅含OpenML-CC18原始数量50%的子集,其对算法评估同样有用。就算法而言,本文提出的方法学将Random Forest识别为具有最佳内在能力的算法。

关键词

引用

@article{arxiv.2107.07451,
  title  = {Data vs classifiers, who wins?},
  author = {Lucas F. F. Cardoso and Vitor C. A. Santos and Regiane S. Kawasaki Francês and Ricardo B. C. Prudêncio and Ronnie C. O. Alves},
  journal= {arXiv preprint arXiv:2107.07451},
  year   = {2021}
}

备注

34 pages, 7 figures and 9 tables