中文

大规模推断:面向大型搜索与推荐实验的显著性检验

信息检索 2023-05-15 v2

摘要

已有若干信息检索研究评估了哪些统计技术适用于系统比较。然而,这些研究聚焦于 TREC 风格的实验,通常具有少于 100 个主题。针对大型搜索与推荐实验尚无类似工作;此类研究通常具有数千个主题或用户以及稀疏得多的相关性判断,因此尚不清楚针对传统 TREC 实验的分析建议是否适用于这些场景。本文中,我们实证研究了显著性检验在大型搜索与推荐评估数据下的行为。结果表明,对于大样本量,Wilcoxon 检验与符号检验的 I 类错误率显著高于 bootstrap、随机化与 t 检验,后三者与预期错误率更为一致。尽管这些统计检验在较小样本量下展现出功效差异,但在大样本量下其功效无差异。我们建议不应使用符号检验与 Wilcoxon 检验来分析大规模评估结果。我们的结果表明,在 Top-N 推荐与大型搜索评估数据下,大多数检验发现统计显著结果的概率为 100%。因此,应使用效应量来确定实际或科学显著性。

关键词

引用

@article{arxiv.2305.02461,
  title  = {Inference at Scale Significance Testing for Large Search and Recommendation Experiments},
  author = {Ngozi Ihemelandu and Michael D. Ekstrand},
  journal= {arXiv preprint arXiv:2305.02461},
  year   = {2023}
}

备注

Published in ACM SIGIR 2023