中文

语言模型重排器受词汇相似性欺骗

计算与语言 2025-06-25 v2 人工智能

摘要

语言模型 (LM) 重排器用于优化检索增强生成 (RAG) 的检索结果。它们比 BM25 等词汇匹配方法成本更高,但被假设能更好地处理语义信息以及查询与检索答案之间的关系。为了解 LM 重排器是否总能符合这一假设,我们在 NQ、LitQA2 和 DRUID 数据集上评估了 6 种不同的 LM 重排器。我们的结果表明,LM 重排器在 DRUID 上难以超越简单的 BM25 基线。利用一种基于 BM25 分数的新型分离度量,我们解释并识别了源于词汇不相似性的重排器错误。我们还研究了提高 LM 重排器性能的不同方法,发现这些方法主要对 NQ 有效。总而言之,我们的工作识别并解释了 LM 重排器的弱点,指出需要更具对抗性和更真实的数据集来对其进行评估。

关键词

引用

@article{arxiv.2502.17036,
  title  = {Language Model Re-rankers are Fooled by Lexical Similarities},
  author = {Lovisa Hagström and Ercong Nie and Ruben Halifa and Helmut Schmid and Richard Johansson and Alexander Junge},
  journal= {arXiv preprint arXiv:2502.17036},
  year   = {2025}
}

备注

Accepted to FEVER 2025