中文

Rank-R1:通过强化学习增强基于 LLM 的文档重排序器推理能力

信息检索 2025-03-11 v1 计算与语言

摘要

本文提出了 Rank-R1,一种新型基于 LLM 的重排序器,可在执行排序任务前对用户查询和候选文档进行推理。现有基于大语言模型(LLM)的文档重排序方法通常依赖提示或微调 LLM,根据候选文档与查询的相关性对其进行排序或标注。对于 Rank-R1,我们使用强化学习算法以及少量相关性标签(无需任何推理监督)来增强基于 LLM 的重排序器的推理能力。我们的假设是,为重排序器增加推理能力可以提高其相关性评估和排序能力。我们在 TREC DL 和 BRIGHT 数据集上的实验表明,Rank-R1 非常有效,尤其是对于复杂查询。具体而言,我们发现 Rank-R1 在域内数据集上的有效性与监督微调方法相当,但仅使用了微调方法 18% 的训练数据。我们还发现,当应用于包含复杂查询的域外数据集时,该模型在很大程度上优于零样本和监督微调方法,尤其是在使用 14B 规模模型时。最后,我们定性观察到 Rank-R1 的推理过程提高了排序结果的可解释性,为搜索引擎结果呈现与利用开辟了新机遇。

关键词

引用

@article{arxiv.2503.06034,
  title  = {Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learning},
  author = {Shengyao Zhuang and Xueguang Ma and Bevan Koopman and Jimmy Lin and Guido Zuccon},
  journal= {arXiv preprint arXiv:2503.06034},
  year   = {2025}
}