中文

神经检索模型在Touch\'e 2020论证检索子集上的系统评估

信息检索 2024-07-11 v1

摘要

神经检索模型的零样例有效性常在BEIR基准上进行评估——该基准是不同IR评估数据集的组合。有趣的是,前期研究发现在BEIR子集Touch\'e 2020上,一种论证检索任务,神经检索模型的效果显著低于BM25。尽管如此,迄今为止尚未对什么使论证检索如此“特殊”进行进一步调查。为更深入分析神经检索模型的潜在限制,我们对Touch\'e 2020数据进行可重复性研究。本研究聚焦两个实验:(i) 黑箱评估(即不进行模型重新训练),纳入理论探索性检索公理;(ii) 数据去噪评估,涉及事后相关性判断。我们的黑箱评估揭示了神经模型倾向于检索Touch\'e 2020数据中短篇段落的内在偏差,我们也发现相当多的神经模型结果在Touch\'e 2020数据中未被判断。由于许多短篇Touch\'e段落本身非论证性且不相关,缺失的判断也使公平比较复杂化,我们通过排除长度不足20个单词的短段落,并遵循Touch\'e指南对未判断的数据进行事后判断来去噪Touch\'e 2020数据。在去噪后数据上,神经模型的效果提升了最高可达0.52的nDCG@10,但BM25仍然更有效。我们的代码和增强后的Touch\'e 2020数据集已提供于\url{https://github.com/castorini/touche-error-analysis}。

关键词

引用

@article{arxiv.2407.07790,
  title  = {Systematic Evaluation of Neural Retrieval Models on the Touch\'e 2020 Argument Retrieval Subset of BEIR},
  author = {Nandan Thakur and Luiz Bonifacio and Maik Fröbe and Alexander Bondarenko and Ehsan Kamalloo and Martin Potthast and Matthias Hagen and Jimmy Lin},
  journal= {arXiv preprint arXiv:2407.07790},
  year   = {2024}
}

备注

SIGIR 2024 (Resource & Reproducibility Track)