分层GRPO:处理LLM搜索代理中的结构异构性
机器学习
2025-10-08 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)代理越来越依赖诸如搜索引擎等外部工具来解决复杂的多步骤问题,强化学习(RL)已成为训练它们的关键范式。然而,搜索代理的轨迹具有结构异构性,其中搜索调用的数量、位置和结果的差异导致 fundamentally 不同的答案方向和奖励分布。使用单一全局基准的标准策略梯度方法会受到我们识别并形式化的跨层次偏差——一种“苹果和橘子”比较异构轨迹的现象。这种跨层次偏差扭曲了信用分配,并阻碍了对复杂多步骤搜索策略的探索。为此,我们提出了分层GRPO,其核心组件为分层优势归一化(SAN),该方法根据轨迹的结构属性将轨迹划分为均匀的层次,并在每个层次内局部计算优势。这确保仅对真正的同伴进行评估。我们的分析证明,SAN消除了跨层次偏差,产生在每个层次内条件无偏且单位方差的估计,同时保持标准归一化所享有的全局无偏性和单位方差特性,从而产生更纯粹且尺度稳定的学习信号。为改善有限样本情境下的实际稳定性,我们进一步将SAN与全局估计器进行线性混合。广泛的实验在多样化的单跳和多跳问答基准测试上表明,分层GRPO在GRPO基础上一致且显著地提高了最高达11.3分,实现更高的训练奖励、更好的训练稳定性和更有效的搜索策略。这些结果确立了分层作为解决LLM搜索代理中结构异构性RL问题的原则性解决方案。
引用
@article{arxiv.2510.06214,
title = {Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents},
author = {Mingkang Zhu and Xi Chen and Bei Yu and Hengshuang Zhao and Jiaya Jia},
journal= {arXiv preprint arXiv:2510.06214},
year = {2025}
}