大规模推断:面向大型搜索与推荐实验的显著性检验
信息检索
2023-05-15 v2
摘要
已有若干信息检索研究评估了哪些统计技术适用于系统比较。然而,这些研究聚焦于 TREC 风格的实验,通常具有少于 100 个主题。针对大型搜索与推荐实验尚无类似工作;此类研究通常具有数千个主题或用户以及稀疏得多的相关性判断,因此尚不清楚针对传统 TREC 实验的分析建议是否适用于这些场景。本文中,我们实证研究了显著性检验在大型搜索与推荐评估数据下的行为。结果表明,对于大样本量,Wilcoxon 检验与符号检验的 I 类错误率显著高于 bootstrap、随机化与 t 检验,后三者与预期错误率更为一致。尽管这些统计检验在较小样本量下展现出功效差异,但在大样本量下其功效无差异。我们建议不应使用符号检验与 Wilcoxon 检验来分析大规模评估结果。我们的结果表明,在 Top-N 推荐与大型搜索评估数据下,大多数检验发现统计显著结果的概率为 100%。因此,应使用效应量来确定实际或科学显著性。
引用
@article{arxiv.2305.02461,
title = {Inference at Scale Significance Testing for Large Search and Recommendation Experiments},
author = {Ngozi Ihemelandu and Michael D. Ekstrand},
journal= {arXiv preprint arXiv:2305.02461},
year = {2023}
}
备注
Published in ACM SIGIR 2023