中文

SPLADE 重排序中交叉编码器与 LLM 的全面比较

信息检索 2024-03-18 v1

摘要

在重新排序有效的 SPLADE 检索器的背景下,我们对交叉编码器和 LLM 重排序器进行了比较研究。我们在 TREC 深度学习数据集以及 BEIR 和 LoTTE 等域外数据集上进行了大规模评估。在第一组实验中,我们展示了在 MS MARCO 上对 SPLADE 进行重排序时,交叉编码器重排序器很难区分。在域外场景中观察结果发生了变化,模型类型和待重排序文档的数量都对有效性有影响。然后,我们重点关注基于大型语言模型的列表式重排序器——尤其是 GPT-4。虽然 GPT-4 展示了令人印象深刻的(零样本)性能,但我们表明传统的交叉编码器仍然具有很强的竞争力。总体而言,我们的发现旨在为最近围绕基于 LLM 的重排序器的热潮提供更细致的视角——将它们定位为在搜索系统中平衡有效性和效率时需要考虑的另一个因素。

关键词

引用

@article{arxiv.2403.10407,
  title  = {A Thorough Comparison of Cross-Encoders and LLMs for Reranking SPLADE},
  author = {Hervé Déjean and Stéphane Clinchant and Thibault Formal},
  journal= {arXiv preprint arXiv:2403.10407},
  year   = {2024}
}