链接证据:面向深度搜索智能体的基于引文感知评分准则奖励的鲁棒强化学习
计算与语言
2026-01-12 v1
摘要
强化学习(RL)已成为增强基于大语言模型(LLM)的深度搜索智能体的关键技术。然而,现有方法主要依赖于二元结果奖励,这无法捕捉智能体推理过程的全面性和事实性,并常常导致诸如捷径利用和幻觉等不良行为。为了解决这些局限性,我们提出了引文感知评分准则奖励(CaRR),这是一个用于深度搜索智能体的细粒度奖励框架,强调推理的全面性、事实基础和证据连通性。CaRR 将复杂问题分解为可验证的单跳评分准则,并要求智能体通过明确识别隐藏实体、用正确的引文支持它们以及构建链接到预测答案的完整证据链来满足这些准则。我们进一步引入了引文感知群体相对策略优化(C-GRPO),它结合了 CaRR 和结果奖励来训练鲁棒的深度搜索智能体。实验表明,C-GRPO 在多个深度搜索基准上一致性地优于标准的基于结果的 RL 基线。我们的分析还验证了 C-GRPO 有效地抑制了捷径利用,促进了全面、基于证据的推理,并对开放式的深度研究任务表现出强大的泛化能力。我们的代码和数据可在 https://github.com/THUDM/CaRR 获取。
引用
@article{arxiv.2601.06021,
title = {Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards},
author = {Jiajie Zhang and Xin Lv and Ling Feng and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2601.06021},
year = {2026}
}