中文

SRR-Judge:用于增强搜索代理搜索集成推理的分步评级与细化

计算与语言 2026-02-10 v1 信息检索

摘要

最近构建的基于大型推理模型(LRMs)的深度搜索代理在复杂问题解答中表现出色,通过迭代规划、行动和收集证据,这一能力称为搜索集成推理。然而,主流方法通常仅使用结果为导向的监督训练,忽略中间思考和行动的质量。我们引入SRR-Judge,一个可靠评估推理与搜索行动的框架。集成到修改后的ReAct风格的评估-细化工作流程中,SRR-Judge为搜索集成推理提供细粒度指导,并支持高效的后训练标注。使用SRR标注数据,我们应用迭代式拒绝采样微调程序来增强基础代理的深度搜索能力。经验上,SRR-Judge在分步评估方面比像DeepSeek-V3.1这样的大型模型更可靠,其评级与最终答案正确性呈现强相关性。此外,将策略与SRR-Judge标注的轨迹对齐可带来显著的性能提升,在具有挑战性的深度搜索基准中平均绝对pass@1提升超过10个百分点。

关键词

引用

@article{arxiv.2602.07773,
  title  = {SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents},
  author = {Chen Zhang and Kuicai Dong and Dexun Li and Wenjun Li and Qu Yang and Wei Han and Yong Liu},
  journal= {arXiv preprint arXiv:2602.07773},
  year   = {2026}
}