生成式查询与文档扩展何时失效?跨方法、检索器与数据集的综合研究
信息检索
2024-02-28 v2 人工智能
计算与语言
摘要
利用大型语言模型(LMs)进行查询或文档扩展可改善信息检索中的泛化能力。然而,尚不清楚这些技术是普遍有益还是仅在特定设置下有效,例如对于特定检索模型、数据集领域或查询类型。为回答此问题,我们首次对基于 LM 的扩展进行了综合分析。我们发现检索器性能与扩展带来的增益之间存在强烈的负相关:扩展改善了较弱模型的分数,但通常损害较强模型。我们表明这一趋势在十一类扩展技术、十二个具有多样分布偏移的数据集以及二十四个检索模型上均成立。通过定性错误分析,我们推测尽管扩展提供了额外信息(可能改善召回率),但它们引入了额外噪声,使得难以区分顶部相关文档(从而引入假阳性)。我们的结果建议如下方案:对较弱模型或当目标数据集在格式上与训练语料显著不同时使用扩展;否则,避免扩展以保持相关性信号清晰。
引用
@article{arxiv.2309.08541,
title = {When do Generative Query and Document Expansions Fail? A Comprehensive Study Across Methods, Retrievers, and Datasets},
author = {Orion Weller and Kyle Lo and David Wadden and Dawn Lawrie and Benjamin Van Durme and Arman Cohan and Luca Soldaini},
journal= {arXiv preprint arXiv:2309.08541},
year = {2024}
}
备注
EACL 2024 camera ready