面向 passage 排序的 ReasonRank:赋予强推理能力
信息检索
2026-04-23 v3 人工智能
计算与语言
机器学习
摘要
基于大语言模型(LLM)的列表化排序在许多 passage 排序任务中显示出优异性能。随着大推理模型(LRMs)的发展,许多研究表明,在测试期间进行逐步推理有助于提高列表化排序性能。然而,由于推理密集型训练数据稀缺,现有重排序器在许多复杂排序场景中表现不佳,推理密集型重排序器的排序能力仍 largely 发展不足。本文首先提出一种自动化推理密集型训练数据合成框架,源自多样化领域的训练查询和 passage,并应用DeepSeek-R1生成高质量训练标签。为赋予列表化重排序器强大的推理能力,我们进一步提出两种阶段的训练方法,包括冷启动监督微调 (SFT) 阶段和强化学习(RL)阶段。在RL阶段,我们设计了一种针对列表化排序多轮次性质的新型多视图排序奖励。广泛实验表明,我们训练的推理密集型重排序器ReasonRank显著优于现有基线,同时也比基于点的方法重排序器实现 much 更低的延迟。我们的代码已公开于https://github.com/8421BCD/ReasonRank。
关键词
引用
@article{arxiv.2508.07050,
title = {ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability},
author = {Wenhan Liu and Xinyu Ma and Weiwei Sun and Yutao Zhu and Yuchen Li and Dawei Yin and Zhicheng Dou},
journal= {arXiv preprint arXiv:2508.07050},
year = {2026}
}
备注
25 pages, accepted by ACL2026 main conference