一种在比较集操纵下稳定的多重比较基准评估方法
统计方法学
2023-05-23 v1 人工智能
机器学习
性能
摘要
在计算机科学与机器学习中,利用基准评估衡量进展十分普遍。然而,分析和呈现多种算法在多个数据集上基准比较结果的常用方法,如 Demšar(2006)提出的临界差异图,存在重要缺陷,且我们表明其易遭受无意与有意的操纵。为解决这些问题,我们提出一种呈现基准比较结果的新方法——多重比较矩阵(MCM),其优先 pairwise 比较并排除现有方法中操纵实验结果的手段。MCM 可用于展示全配对比较结果,或展示一个或多个选定算法与最先进技术间的比较结果。MCM 以 Python 实现并公开可用。
引用
@article{arxiv.2305.11921,
title = {An Approach to Multiple Comparison Benchmark Evaluations that is Stable Under Manipulation of the Comparate Set},
author = {Ali Ismail-Fawaz and Angus Dempster and Chang Wei Tan and Matthieu Herrmann and Lynn Miller and Daniel F. Schmidt and Stefano Berretti and Jonathan Weber and Maxime Devanne and Germain Forestier and Geoffrey I. Webb},
journal= {arXiv preprint arXiv:2305.11921},
year = {2023}
}