SRR-Judge:用于增强搜索代理搜索集成推理的分步评级与细化
计算与语言
2026-02-10 v1 信息检索
摘要
最近构建的基于大型推理模型(LRMs)的深度搜索代理在复杂问题解答中表现出色,通过迭代规划、行动和收集证据,这一能力称为搜索集成推理。然而,主流方法通常仅使用结果为导向的监督训练,忽略中间思考和行动的质量。我们引入SRR-Judge,一个可靠评估推理与搜索行动的框架。集成到修改后的ReAct风格的评估-细化工作流程中,SRR-Judge为搜索集成推理提供细粒度指导,并支持高效的后训练标注。使用SRR标注数据,我们应用迭代式拒绝采样微调程序来增强基础代理的深度搜索能力。经验上,SRR-Judge在分步评估方面比像DeepSeek-V3.1这样的大型模型更可靠,其评级与最终答案正确性呈现强相关性。此外,将策略与SRR-Judge标注的轨迹对齐可带来显著的性能提升,在具有挑战性的深度搜索基准中平均绝对pass@1提升超过10个百分点。
引用
@article{arxiv.2602.07773,
title = {SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents},
author = {Chen Zhang and Kuicai Dong and Dexun Li and Wenjun Li and Qu Yang and Wei Han and Yong Liu},
journal= {arXiv preprint arXiv:2602.07773},
year = {2026}
}