论 MS MARCO 中的幸存者偏差
信息检索
2022-04-28 v1
摘要
幸存者偏差是指倾向于关注选择过程中的正面结果,而忽视产生负面结果的那些结果。我们观察到,这种偏差可能存在于流行的 MS MARCO 数据集中,因为标注者无法为 38% 至 45% 的查询找到答案,导致这些查询在训练和评估过程中被丢弃。尽管我们发现 MS MARCO 中一些被丢弃的查询定义不清或无法回答,但许多是有效的问题,如果对集合进行更完整的标注,是可以回答的(使用现代排序技术,约三分之二可回答)。这种幸存者问题在多个方面扭曲了 MS MARCO 集合。我们发现它影响了查询在所需信息类型方面的自然分布。当用于评估时,我们发现该偏差可能导致观察到的绝对性能分数出现显著扭曲。最后,鉴于 MS MARCO 常被用于模型训练,我们基于模拟更强幸存者偏差的 MS MARCO 子集训练模型。我们发现,在此设置下训练的模型,在具有更完整标注的数据集版本上评估时,性能最多下降 9.9%,在零样本迁移中最多下降 3.5%。我们的发现与其他近期关于进一步标注 MS MARCO 的建议互补,但侧重于被丢弃的查询。用于复现本文结果的代码和数据可在在线附录中获取。
引用
@article{arxiv.2204.12852,
title = {On Survivorship Bias in MS MARCO},
author = {Prashansa Gupta and Sean MacAvaney},
journal= {arXiv preprint arXiv:2204.12852},
year = {2022}
}
备注
SIGIR 2022