训练-测试泄漏如何影响零样本检索
信息检索
2022-08-31 v2
摘要
神经检索模型通常在 MS MARCO / ORCAS 数据集的数百万查询的(子集)上训练,然后在 250 个 Robust04 查询或其他 TREC 基准上测试,后者往往仅有 50 个查询。在此类设置中,少数测试查询中的许多可能与海量训练数据中的查询非常相似——事实上,69% 的 Robust04 查询在 MS MARCO / ORCAS 中存在近似重复。我们通过在使用固定数量的与真实测试查询高度相似的 MS MARCO / ORCAS 查询以及数量递增的其他查询的组合上训练神经检索模型,来研究这种无意的训练-测试泄漏的影响。我们发现泄漏可以提升效果,甚至改变系统的排名。然而,随着所有训练实例中泄漏比例的降低(从而变得更贴近现实),这些影响会减弱。
引用
@article{arxiv.2206.14759,
title = {How Train-Test Leakage Affects Zero-shot Retrieval},
author = {Maik Fröbe and Christopher Akiki and Martin Potthast and Matthias Hagen},
journal= {arXiv preprint arXiv:2206.14759},
year = {2022}
}
备注
To appear at the 29th International Symposium on String Processing and Information Retrieval (SPIRE 2022)