CriticSearch:通过回顾性批评家实现搜索代理的细粒度信用分配
计算与语言
2025-11-18 v1
摘要
集成工具的推理 (TIR) 通过搜索引擎使大型语言模型能够迭代检索最新外部知识,从而在复杂问答任务中提升适应性和泛化能力。然而,现有的搜索代理管道通常依赖基于强化学习的优化, suffers from 稀疏结果奖励,导致探索效率低下且训练不稳定。我们提出 CriticSearch,一种细粒度信用分配框架,通过回顾性批评家机制提供稠密的、每轮的反馈。在训练期间,一个冻结的、非对称的批评 LLM 利用来自完整轨迹和金标准答案的特权信息, retrospective 地评估每一轮,将这些评估转化为稳定的、稠密的奖励,以引导策略改进。跨 diverse 多跳推理基准的实验结果表明,CriticSearch 在所有基准上都显著优于现有基线,实现了更快的收敛、更好的训练稳定性以及更高的性能。
引用
@article{arxiv.2511.12159,
title = {CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic},
author = {Yaocheng Zhang and Haohuan Huang and Zijun Song and Yuanheng Zhu and Qichao Zhang and Zijie Zhao and Dongbin Zhao},
journal= {arXiv preprint arXiv:2511.12159},
year = {2025}
}
备注
17 pages, 10 figures