中文

增强分类器评估:一种基于能力与鲁棒性的更公平基准测试策略

机器学习 2025-04-15 v1

摘要

基准测试是机器学习(ML)中用于比较分类算法性能的基本实践。然而,传统评估方法往往忽视了一个关键方面:对数据集复杂度与算法泛化能力的联合考量。缺乏这种双重视角,评估可能会偏向于在简单实例上表现良好但未能捕捉其真正鲁棒性的模型。为解决这一局限,本研究引入了一种新颖的评估方法,将项目反应理论(IRT)与最初为衡量竞技游戏中玩家实力而开发的 Glicko-2 评分系统相结合。IRT 基于分类器在困难实例上的表现评估其能力,而 Glicko-2 通过分类器之间的模拟锦标赛更新性能指标——如评分、偏差和波动性。这种组合方法提供了对算法能力更公平、更细致的度量。使用 OpenML-CC18 基准进行的案例研究表明,仅有 15% 的数据集真正具有挑战性,且一个包含原始数据集 50% 的缩减子集提供了相当的评估能力。在所测试的算法中,随机森林取得了最高的能力评分。结果凸显了通过聚焦数据集质量并采用反映难度与分类器熟练度的评估策略来改进基准设计的重要性。

关键词

引用

@article{arxiv.2504.09759,
  title  = {Enhancing Classifier Evaluation: A Fairer Benchmarking Strategy Based on Ability and Robustness},
  author = {Lucas Cardoso and Vitor Santos and José Ribeiro and Regiane Kawasaki and Ricardo Prudêncio and Ronnie Alves},
  journal= {arXiv preprint arXiv:2504.09759},
  year   = {2025}
}

备注

47 pages, 16 figures, 9 tables