我们真的应该使用基于平均秩的事后检验吗?
机器学习
2015-05-12 v1 统计理论
数据分析、统计与概率
定量方法
机器学习
统计理论
摘要
多算法在多数据集上的统计比较是机器学习的基础。这通常通过Friedman检验来进行。当Friedman检验拒绝原假设时,进行多重比较以确定算法间的显著差异。多重比较通常使用平均秩检验完成。本技术笔记旨在讨论平均秩事后检验的不一致性,以阻止其在机器学习以及医学、心理学等领域中的使用。我们表明平均秩检验的结果依赖于最初纳入实验的算法池。换言之,算法A与B之间的比较结果也取决于原始实验中所包含的其他算法的性能。这可能导致悖论情形。例如,若池包含算法C、D、E,则A与B之间的差异可被声明为显著;若池包含算法F、G、H,则不显著。为克服这些问题,我们建议改用其结果仅依赖于被比较的两个算法的检验,例如符号检验或Wilcoxon符号秩检验。
引用
@article{arxiv.1505.02288,
title = {Should we really use post-hoc tests based on mean-ranks?},
author = {Alessio Benavoli and Giorgio Corani and Francesca Mangili},
journal= {arXiv preprint arXiv:1505.02288},
year = {2015}
}