面向稀疏标注的浅池化
信息检索
2022-03-02 v2
摘要
近年来,核心 IR 任务(包括文档与段落排序)取得了巨大进展。数据集与排行榜,尤其是 MS MARCO 数据集,展示了现代神经排序器所实现的显著改进。与传统测试集相比,MS MARCO 数据集使用了更多的查询,而每查询的已知相关项却少得多。鉴于这些相关性标注的稀疏性,MS MARCO 排行榜以平均倒数排名(MRR)追踪改进。本质上,一个相关项被视为“正确答案”,排序器根据其将该项排在高位的能力打分。在处理这些稀疏标注时,我们观察到排序器返回的顶部项往往看起来优于已判定的相关项。为验证该观察,我们雇佣众包工作者对现代神经排序栈返回的顶部项与已判定的相关项进行偏好判断。结果支持我们的观察。若设想一个在 MRR 下完美的排序器,在所有查询上得分为 1,我们的偏好判断表明,搜索者会更频繁地偏好现代神经排序栈的顶部结果,而非虚构完美排序器的顶部结果,使我们的神经排序器“优于完美”。为理解对排行榜的影响,我们对段落排序排行榜顶部附近可用运行的超过 500 个查询的顶级文档进行池化。我们雇佣众包工作者对这些池进行偏好判断并重新评估这些运行。我们的结果支持了我们的担忧:当前 MS MARCO 数据集可能已无法识别排序器的真正改进。未来,若排序器以单一“正确答案”衡量,该答案应为最佳答案或最受偏好答案,并通过持续判断来维护。
引用
@article{arxiv.2109.00062,
title = {Shallow pooling for sparse labels},
author = {Negar Arabzadeh and Alexandra Vtyurina and Xinyi Yan and Charles L. A. Clarke},
journal= {arXiv preprint arXiv:2109.00062},
year = {2022}
}