MS-Shift:对 MS MARCO 分布偏移下神经检索的分析
信息检索
2023-01-26 v2
摘要
预训练语言模型近来在信息检索中崭露头角,为新一代神经系统的骨干,其在多项任务上超越传统方法。然而,此类方法在零样本条件下的泛化能力仍不明晰。近期的 BEIR 基准通过在与训练条件不同的数据集与任务上比较模型,部分回答了该问题。我们旨在通过更显式的分布偏移下比较模型来探讨同一问题。为此,我们在 MS MARCO 内构建了三种基于查询的分布偏移(查询语义、查询意图、查询长度),用以评估基于 BERT 的三类主要神经检索器:稀疏、稠密与延迟交互——以及 monoBERT 重排序器。我们进一步分析了训练与测试查询分布间的性能下降。特别地,我们实验了两种泛化指示量:其一基于训练/测试查询词表重叠,其二基于训练好的双编码器表示。直观上,这些指示量验证了测试集离训练集越远,性能下降越严重。我们还表明模型对偏移的响应不同——稠密方法受冲击最大。总体而言,我们的研究证明可设计更具可控性的分布偏移,作为更好理解 IR 模型泛化的工具。最后,我们发布了 MS MARCO 查询子集,为信息检索零样本迁移基准提供了额外资源。
引用
@article{arxiv.2205.02870,
title = {MS-Shift: An Analysis of MS MARCO Distribution Shifts on Neural Retrieval},
author = {Simon Lupart and Thibault Formal and Stéphane Clinchant},
journal= {arXiv preprint arXiv:2205.02870},
year = {2023}
}
备注
Accepted at ECIR 2023