负面优势是双刃剑:为搜索代理校准GRPO中的优势
计算与语言
2026-05-28 v2 人工智能
摘要
搜索代理通过与搜索引擎的多轮交互实现强大的问答性能,Group Relative Policy Optimization(GRPO)是广泛使用的训练算法。然而,GRPO等算法在多跳搜索设置中仍面临若干挑战。首先,当最终答案错误时,正确的中间步骤常被惩罚。其次,训练高度不稳定,常导致自然语言能力退化甚至严重训练崩溃。我们的分析将这些问题归因于粗粒度的优势分配以及正负优势之间的不平衡。为解决这些问题,我们提出CalibAdv,这是一种为搜索代理设计的优势校准方法,使其能够更准确、更稳定地建模惩罚和奖励。具体而言,CalibAdv利用中间步骤的正确性,对过度的负面优势进行细粒度的downscaling。随后进一步重新平衡正负优势以提高训练稳定性。重要的是,CalibAdv采用轻量级设计,从标准 rollout 信号校准优势,使其简单易用。广泛的实验在三个模型和七个基准上表明,CalibAdv提高了模型性能和训练稳定性。我们的代码可在 https://github.com/wujwyi/CalibAdv 获取。
引用
@article{arxiv.2604.18235,
title = {Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents},
author = {Jiayi Wu and Ruobing Xie and Zeqian Huang and Lei Jiang and Can Xu and Kangyang Luo and Bochen Lin and Ming Gao and Xiang Li},
journal= {arXiv preprint arXiv:2604.18235},
year = {2026}
}