中文

训练-测试泄漏如何影响零样本检索

信息检索 2022-08-31 v2

摘要

神经检索模型通常在 MS MARCO / ORCAS 数据集的数百万查询的(子集)上训练,然后在 250 个 Robust04 查询或其他 TREC 基准上测试,后者往往仅有 50 个查询。在此类设置中,少数测试查询中的许多可能与海量训练数据中的查询非常相似——事实上,69% 的 Robust04 查询在 MS MARCO / ORCAS 中存在近似重复。我们通过在使用固定数量的与真实测试查询高度相似的 MS MARCO / ORCAS 查询以及数量递增的其他查询的组合上训练神经检索模型,来研究这种无意的训练-测试泄漏的影响。我们发现泄漏可以提升效果,甚至改变系统的排名。然而,随着所有训练实例中泄漏比例的降低(从而变得更贴近现实),这些影响会减弱。

关键词

引用

@article{arxiv.2206.14759,
  title  = {How Train-Test Leakage Affects Zero-shot Retrieval},
  author = {Maik Fröbe and Christopher Akiki and Martin Potthast and Matthias Hagen},
  journal= {arXiv preprint arXiv:2206.14759},
  year   = {2022}
}

备注

To appear at the 29th International Symposium on String Processing and Information Retrieval (SPIRE 2022)