中文

我们真的应该使用基于平均秩的事后检验吗?

机器学习 2015-05-12 v1 统计理论 数据分析、统计与概率 定量方法 机器学习 统计理论

摘要

多算法在多数据集上的统计比较是机器学习的基础。这通常通过Friedman检验来进行。当Friedman检验拒绝原假设时,进行多重比较以确定算法间的显著差异。多重比较通常使用平均秩检验完成。本技术笔记旨在讨论平均秩事后检验的不一致性,以阻止其在机器学习以及医学、心理学等领域中的使用。我们表明平均秩检验的结果依赖于最初纳入实验的算法池。换言之,算法A与B之间的比较结果也取决于原始实验中所包含的其他算法的性能。这可能导致悖论情形。例如,若池包含算法C、D、E,则A与B之间的差异可被声明为显著;若池包含算法F、G、H,则不显著。为克服这些问题,我们建议改用其结果仅依赖于被比较的两个算法的检验,例如符号检验或Wilcoxon符号秩检验。

关键词

引用

@article{arxiv.1505.02288,
  title  = {Should we really use post-hoc tests based on mean-ranks?},
  author = {Alessio Benavoli and Giorgio Corani and Francesca Mangili},
  journal= {arXiv preprint arXiv:1505.02288},
  year   = {2015}
}