中文

LLM 对 IR 基准的影响:有效性、基线与污染物的元分析

信息检索 2026-04-08 v1

摘要

基准集合长期以来使信息检索(IR)领域得以进行受控比较和累积进展。然而,先前的元分析表明,报告的有效性提升往往未能累积,部分原因在于使用了较弱或过时的基线。虽然大型语言模型越来越多地被用于检索流水线,但它们对已建立的 IR 基准的影响尚未得到系统分析。在本研究中,我们分析了 143 篇报告 TREC Robust04 集合和 TREC 深度学习 2020(DL20)段落检索基准结果的出版物,以考察检索有效性和基线强度的纵向趋势。我们观察到了所谓的 \emph{LLM 效应}:最近纳入 LLM 组件的系统在 DL20 上比 TREC 2020 的最佳结果高出 8.8% 的 nDCG@10,自 2023 年以来在 Robust04 上高出约 20%。然而,将一种数据污染检测方法适配到重排后,揭示了两个基准中都存在可测量的污染。虽然排除受污染主题会降低有效性,但置信区间仍然很宽,使得难以确定 LLM 效应反映的是真正的 方法学进步还是来自预训练数据的记忆。

关键词

引用

@article{arxiv.2604.05766,
  title  = {The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination},
  author = {Moritz Staudinger and Wojciech Kusa and Allan Hanbury},
  journal= {arXiv preprint arXiv:2604.05766},
  year   = {2026}
}

备注

Accepted at SIGIR 2026