利用查询变体生成器评估检索管道的鲁棒性
信息检索
2022-02-16 v3
摘要
用于语言建模的深度预训练 Transformer,如 BERT,已被证明对于信息检索(IR)任务非常有效,通常应用于对第一阶段检索模型的结果进行重排序。IR 基准测试基于使用单个查询来实例化底层信息需求的前提来评估检索管道的有效性。然而,先前的研究表明:(I) 用户为固定信息需求生成的查询变化极大,特别是 (II) 神经模型很脆弱,当使用修改后的输入进行测试时经常出错。受这些观察结果的启发,我们旨在回答以下问题:检索管道对于不改变查询语义的不同查询变体的鲁棒性如何?为了获得能代表用户查询变异性的查询,我们首先基于对用户创建的查询变体数据集(UQV100)中发生的变换进行手动标注,创建了一个分类法。对于我们分类法中每个改变句法的类别,我们采用了不同的自动方法,当应用于一个查询时,会生成一个查询变体。我们在两个数据集上针对两个 IR 任务的实验结果表明,检索管道对这些查询变体并不鲁棒,有效性平均下降约 。代码和数据集可在 https://github.com/Guzpenha/query_variation_generators 获取。
引用
@article{arxiv.2111.13057,
title = {Evaluating the Robustness of Retrieval Pipelines with Query Variation Generators},
author = {Gustavo Penha and Arthur Câmara and Claudia Hauff},
journal= {arXiv preprint arXiv:2111.13057},
year = {2022}
}
备注
Accepted for publication in the 44nd European Conference on Information Retrieval (ECIR'22). V3: Fixed Table 2