中文

InsertRank: 大语言模型能基于BM25分数进行推理以改进列表式重排序

信息检索 2025-06-18 v1 人工智能 计算与语言

摘要

大型语言模型凭借其从广泛预训练中获得的强大泛化和知识迁移能力,在各种信息检索任务中取得了显著进展,特别是作为重排序器。与此同时,基于LLM的聊天界面的兴起提高了用户的期望,鼓励用户提出更复杂的查询,这些查询需要通过“推理”文档而非简单的关键词匹配或语义相似性来进行检索。尽管最近的一些工作利用了LLM的推理能力来对此类查询进行重排序,但仍有很大的改进潜力。为此,我们引入了InsertRank,一种基于LLM的重排序器,它在重排序过程中利用BM25分数等词汇信号来进一步提高检索性能。InsertRank在BRIGHT(一个涵盖12个不同领域的推理基准)和R2MED(一个涵盖8个不同任务的专门医学推理检索基准)上展示了改进的检索效果。我们进行了详尽的评估和多项消融研究,并证明InsertRank在多个LLM家族(包括GPT、Gemini和Deepseek模型)中持续提高了检索效果。使用Deepseek-R1,InsertRank在BRIGHT基准上达到37.5分,在R2MED基准上达到51.1分,超越了先前的方法。

关键词

引用

@article{arxiv.2506.14086,
  title  = {InsertRank: LLMs can reason over BM25 scores to Improve Listwise Reranking},
  author = {Rahul Seetharaman and Kaustubh D. Dhole and Aman Bansal},
  journal= {arXiv preprint arXiv:2506.14086},
  year   = {2025}
}