中文

LTRR:用于大语言模型的检索器学习排序

计算与语言 2026-04-21 v2 信息检索

摘要

检索增强生成(RAG)系统通常依赖单一固定检索器,尽管越来越多的证据表明没有任何单一检索器在所有查询类型上表现最优。在本文中,我们探索了一种查询路由方法,根据查询从检索器池中动态选择,使用无训练启发式方法和学习路由模型。我们将路由建模为学习排序问题,并提出了 LTRR(Learning To Rank Retrievers)框架,根据检索器对下游 RAG 性能的预期贡献对其进行学习排序。通过在具有受控查询类型变化的多样化问答基准上的实验,我们证明基于路由的 RAG 一致地超越了最强的单检索器基线。当使用答案正确性(AC)目标进行训练以及使用成对排序方法时,提升尤为显著,XGBoost 取得了最佳结果。此外,我们的方法展现出更强的分布外查询泛化能力。总体而言,我们的结果强调了训练策略和优化指标选择在 RAG 系统有效查询路由中的关键作用。

关键词

引用

@article{arxiv.2506.13743,
  title  = {LTRR: Learning To Rank Retrievers for LLMs},
  author = {To Eun Kim and Fernando Diaz},
  journal= {arXiv preprint arXiv:2506.13743},
  year   = {2026}
}

备注

SIGIR 2026; SIGIR 2025 LiveRAG Spotlight; Code: https://github.com/kimdanny/Starlight-LiveRAG