Agent 搜索中的 Group Relative Policy Optimization 消融现象:惇�意似然位移
计算与语言
2026-02-03 v2
摘要
工具集成(TI)强化学习(RL)使大语言模型(LLM)能够通过与搜索引擎和检索器等外部工具交互来进行多步推理。以 Group Relative Policy Optimization(GRPO)为代表的方法,如 Search-R1,具有快速收敛和无价值函数建模的优势,因而备受青睐,但始终会出现训练消融问题。我们识别出惇�意似然位移(Lazy Likelihood Displacement, LLD),即正确响应和错误响应的似然性在系统性降低或停滞的情况,作为引发此类失败的核心机制。LLD 早期出现,并触发自我强化的 LLD 死亡螺旋:似然性下降导致低置信度响应,进而扩大梯度,最终导致消融。我们在 Search-R1 风格的搜索集成问答任务中,对该过程进行了经验性表征,揭示了始终如期的三个阶段轨迹:早期停滞、稳定衰减和加速消融。为解决此问题,我们提出了一种似然保持正则化 LLDS,该方法仅在响应动作的似然性下降时激活,并仅对负责的标记进行正则化。这种细粒度结构以最小干扰抑制 LLD。我们的方法稳定了训练,防止了梯度爆炸,在七个基准测试中实现了显著的性能提升,其中在 Qwen2.5-3B 上的相对提升为 +45.2%,在 Qwen2.5-7B 上的相对提升为 +37.1%。我们的结果表明,LLD 是 GRPO 基于 TIRL 中一个被忽视的瓶颈,并为稳定、可扩展的工具集成 RL 训练提供了实用路径。
引用
@article{arxiv.2512.04220,
title = {On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement},
author = {Wenlong Deng and Yushu Li and Boying Gong and Yi Ren and Christos Thrampoulidis and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2512.04220},
year = {2026}
}