中文

解码机器学习基准

机器学习 2021-03-18 v2 机器学习

摘要

尽管有可用的基准机器学习(ML)仓库(如 UCI、OpenML),目前仍无标准评估策略能够指出哪些数据集组合最适合作为测试不同 ML 算法的黄金标准。在近期研究中,项目反应理论(IRT)已成为阐明何为良好 ML 基准的新方法。本工作应用 IRT 探索知名的 OpenML-CC18 基准,以识别其在分类器评估中的适用性。从经典到集成的一系列分类器使用 IRT 模型进行评估,该模型可同时估计数据集难度与分类器能力。在 IRT 之上应用 Glicko-2 评级系统以总结分类器的内在能力与资质。观察到并非 OpenML-CC18 中所有数据集都真正有助于评估分类器。本工作中评估的大多数数据集(84%)总体包含简单实例(例如仅约 10% 的困难实例)。此外,该基准中一半数据集的 80% 实例为极具区分度的实例,可用于成对算法比较,但无助于提升分类器能力。本文提出这种基于 IRT 的新评估方法以及所开发的工具 decodIRT,用于指导 ML 基准上的 IRT 估计。

关键词

引用

@article{arxiv.2007.14870,
  title  = {Decoding machine learning benchmarks},
  author = {Lucas F. F. Cardoso and Vitor C. A. Santos and Regiane S. K. Francês and Ricardo B. C. Prudêncio and Ronnie C. O. Alves},
  journal= {arXiv preprint arXiv:2007.14870},
  year   = {2021}
}

备注

Paper published at the BRACIS 2020 conference, 15 pages, 4 figures