重新审视推理密集型检索:在智能体搜索系统中评估与推进检索器
计算与语言
2026-05-06 v1 信息检索
摘要
推理密集型检索旨在呈现支持下游推理的证据,而不仅仅是匹配主题相似性。对于智能体搜索系统而言,这种能力日益重要,因为检索器必须在迭代搜索和综合过程中提供互补证据。然而,现有工作在评估和训练两方面均存在局限:诸如 BRIGHT 之类的基准测试仅提供狭窄的标准答案集,并在孤立状态下评估检索器;而合成训练语料库通常优化单段落相关性,而非证据组合的构建。我们引入了 BRIGHT-Pro,这是一个由专家标注的基准测试,它通过多方面标准证据扩展了每个查询,并在静态和智能体搜索协议下评估检索器。我们进一步构建了 RTriever-Synth,一个方面分解的合成语料库,用于生成互补正样本和基于正样本条件的困难负样本,并使用它从 Qwen3-Embedding-4B 进行 LoRA 微调得到 RTrivier-4B。跨越词法、通用和推理密集型检索器的实验表明,方面感知和智能体评估揭示了被标准指标隐藏的行为,同时 RTriever-4B 相比其基础模型有显著提升。
引用
@article{arxiv.2605.04018,
title = {Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems},
author = {Yilun Zhao and Jinbiao Wei and Tingyu Song and Siyue Zhang and Chen Zhao and Arman Cohan},
journal= {arXiv preprint arXiv:2605.04018},
year = {2026}
}
备注
ACL 2026