中文

基于GSD前沿的统计多准则基准测试

机器学习 2024-06-07 v1 机器学习 统计方法学

摘要

鉴于已有(并且仍在不断提出)大量分类器,可靠的比较方法正变得越来越重要。对可靠性的期望分解为三个主要方面:(1) 比较应允许同时考虑不同的质量指标。(2) 比较应考虑由基准测试套件选择引起的统计不确定性。(3) 应能验证在基本假设发生微小偏差时比较的稳健性。为解决(1),我们提出使用广义随机占优排序(GSD)来比较分类器,并提出了GSD前沿作为经典帕累托前沿的信息高效替代方案。对于(2),我们提出了GSD前沿的一致统计估计量,并构建了一个统计检验,用于判断一个(可能是新的)分类器是否位于一组最先进分类器的GSD前沿中。对于(3),我们使用稳健统计和精确概率的技术放宽了我们提出的检验。我们在基准测试套件PMLB和平台OpenML上说明了我们的概念。

关键词

引用

@article{arxiv.2406.03924,
  title  = {Statistical Multicriteria Benchmarking via the GSD-Front},
  author = {Christoph Jansen and Georg Schollmeyer and Julian Rodemann and Hannah Blocher and Thomas Augustin},
  journal= {arXiv preprint arXiv:2406.03924},
  year   = {2024}
}

备注

CJ, GS,JR and HB equally contributed to this work