中文

R1-Ranker:教会 LLM 排序器进行推理

信息检索 2025-10-17 v3 人工智能 机器学习

摘要

大型语言模型 (LLM) 最近在数学、编码和科学问题解决等领域展现出强大的推理能力,但在排序任务(如检索、推荐系统和 LLM 路由)中仍未得到充分探索。排序任务需要跨异构候选对象的复杂推理,但现有的基于 LLM 的排序器往往是领域特定的、依赖固定骨干网络的,且缺乏迭代细化,限制了其充分发挥 LLM 推理潜力的能力。为此,我们提出 R1-Ranker,一个基于强化学习的推理激励框架,包含两个互补设计:DRanker 一次性生成完整排序,IRanker 将排序分解为迭代消除过程,采用分步骤奖励以鼓励更深入的推理。我们在覆盖推荐、路由和 passage 排序等九个数据集上评估统一的 R1-Ranker,表明 IRanker-3B 在各任务上实现了最佳性能,部分任务上超越了更大的 7B 模型,平均相对提升达15.7%。消融和泛化实验进一步确认,强化学习和迭代推理在本任务中发挥关键作用,IRanker-3B 在跨域任务上零样本性能提升超过9%,推理轨迹对其他 LLM 的提升可达最高22.87%。这些结果表明,用单一推理驱动的基础模型统一多样化排序任务既有效且必要,以推动 LLM 在排序场景中的推理能力。

关键词

引用

@article{arxiv.2506.21638,
  title  = {R1-Ranker: Teaching LLM Rankers to Reason},
  author = {Tao Feng and Zhigang Hua and Zijie Lei and Yan Xie and Shuang Yang and Bo Long and Jiaxuan You},
  journal= {arXiv preprint arXiv:2506.21638},
  year   = {2025}
}