中文

两个 MS MARCO 数据集的故事——及其不公平的比较

信息检索 2023-04-26 v1

摘要

MS MARCO-passage 数据集一直是 IR(信息检索)界开放的主要大规模数据集,多年来成功推动了新颖神经检索模型的发展。然而,文献中实际使用了两个不同的 MS MARCO 语料库:官方语料库,以及第二个因 Tevatron 代码库的引入而将段落与标题进行增强的语料库。但是,标题的添加实际上泄露了相关性信息,同时违背了 MS MARCO-passage 数据集的原始准则。在本文中,我们研究了这两个语料库之间的差异,并通过实证表明它们在评估新方法时会造成显著差异。换言之,我们表明如果一篇论文没有恰当报告所使用的版本,公平地复现其结果基本上是不可能的。此外,鉴于当前评审现状中监控 SOTA(state-of-the-art,最优性能)结果极为重要,拥有同一数据集的两个不同版本是一个严重问题。正因如此,本文旨在报告该问题的重要性,以使研究人员意识到这一问题并恰当地报告其结果。

关键词

引用

@article{arxiv.2304.12904,
  title  = {The tale of two MS MARCO -- and their unfair comparisons},
  author = {Carlos Lassance and Stéphane Clinchant},
  journal= {arXiv preprint arXiv:2304.12904},
  year   = {2023}
}

备注

Short paper accepted at SIGIR 2023