信息检索中的统计显著性检验:关于I型、II型和III型错误的实证分析
信息检索
2019-06-07 v2 数字图书馆
机器学习
应用统计
摘要
统计显著性检验被广泛接受为一种评估有效性差异在多大程度上反映系统间实际差异(而非因主题选择导致的随机噪声)的手段。根据近期对SIGIR、CIKM、ECIR和TOIS论文的调查,t检验是IR研究者中最流行的选择。然而,先前工作主要基于理论论证,建议采用如自助法或置换检验等计算密集型检验。基于实证依据,其他人建议采用如Wilcoxon检验等非参数替代方法。确实,我们应使用何种检验的问题已伴随IR及相关领域数十年。先前关于此问题的理论研究受限在于:我们已知IR实验中检验假设不被满足;而实证研究受限在于:我们无法在现实条件下对原假设进行必要控制以计算实际的I型和II型错误率。因此,不仅使用哪种检验不明确,而且我们应在多大程度上信任它们也不明确。与过去研究相反,本文采用一种基于TREC数据的最新仿真方法以规避这些局限。我们的研究包含超过5亿个p值,针对一系列检验、系统、有效性度量、主题集大小和效应大小,以及双尾和单尾情形计算而得。拥有如此大量且完全知晓原假设的IR评估数据,我们终于能够评估统计显著性检验在IR数据中的真实表现,并为实践者提出可靠建议。
引用
@article{arxiv.1905.11096,
title = {Statistical Significance Testing in Information Retrieval: An Empirical Analysis of Type I, Type II and Type III Errors},
author = {Julián Urbano and Harlley Lima and Alan Hanjalic},
journal= {arXiv preprint arXiv:1905.11096},
year = {2019}
}
备注
10 pages, 6 figures, SIGIR 2019