Prism-Reranker:超越相关性评分——为智能检索生成贡献与证据
信息检索
2026-04-28 v1
摘要
现代检索管道越来越多地服务于检索增强生成(RAG)和自主智能体等下游消费者,这些消费者需要的不仅仅是标量相关性得分。仅给出"相关性如何"的排序器会迫使智能体将整个文档输入语言模型上下文,导致对无关段落和模板内容的浪费。我们提出Prism-Reranker,这是一系列建立在Qwen3.5之上的重排序模型,规模为0.8B、2B、4B和9B四种规模,超越标量评分。在除标准的yes/no相关性判断外,当判决为yes时,模型还会输出(1)贡献声明,概括文档如何有助于查询;(2)证据段落:自包含的改写版本,保留所有查询相关信号并消除噪声。Prism-Reranker采用混合目标进行训练,结合来自强大商业重排序API的点分离distillation与针对贡献与证据目标的监督微调。我们从KaLM-Embedding的开源聚合数据中构建训练数据,增强了来自商业搜索API检索的真实网页文档,用于开放域查询;并通过LLM综合生成的变体扩展数据。我们还将部分查询改写为关键词风格,以适配智能体发出的查询。为解决公开语料中标签不一致的问题并获得明确的二进制监督,我们使用LLM-as-Judge集团,对五个前沿LLM的投票进行聚合,以获得一致标签。在BEIR QA子集上以及对贡献与证据质量的LLM评估中,Prism-Reranker在所有四种规模上均取得良好成绩。我们进一步表明,相同的配方也适用于现有的LLM-based重排序器,将Qwen3-Reranker-4B增强为具备贡献与证据能力,使其在BEIR-QA NDCG@10提升1.54分。模型权重、训练配方和评估套件已公开发布。
引用
@article{arxiv.2604.23734,
title = {Prism-Reranker: Beyond Relevance Scoring -- Jointly Producing Contributions and Evidence for Agentic Retrieval},
author = {Dun Zhang},
journal= {arXiv preprint arXiv:2604.23734},
year = {2026}
}
备注
28 pages, 5 figures, 4 tables