中文

面向长期智能体任务的层次化群组策略优化

机器学习 2026-02-27 v1 人工智能

摘要

基于群组的强化学习 (RL),如 GRPO,已推动了大型语言模型在长期智能体任务方面的能力。为了实现更细粒度的策略更新,最近的研究越来越倾向于基于步骤的群组策略优化,该方法在 rollout 轨迹的每个步骤独立处理,同时使用记忆模块保留历史上下文。然而,我们发现在估计步骤相对优势时存在一个关键问题,即上下文不一致性,其中同一群组中的步骤可能因其历史上下文而有所不同。经验上,我们揭示了这一问题可能导致严重的偏置优势估计,从而显著降低策略优化效果。为解决此问题,本文提出了面向长期智能体任务的层次化群组策略优化 (HGPO)。具体而言,在一个群组的 rollout 轨迹中,HGPO 根据历史上下文的一致性将每个步骤分配到多个层次化群组。然后,对于每个步骤,HGPO 在每个群组内计算不同的优势,并采用自适应加权方案对其进行聚合。如此一来,HGPO 能够在步骤级优势估计中实现良好的偏差-方差权衡,无需额外模型或 rollout。在两个具有挑战性的智能体任务 (ALFWorld 和 WebShop) 上使用 Qwen2.5-1.5B-Instruct 和 Qwen2.5-7B-Instruct 进行评估,显示 HGPO 在相同计算约束下显著优于现有的智能体 RL 方法。代码可在 https://github.com/langfengQ/verl-agent/tree/master/recipe/hgpo 获取。

关键词

引用

@article{arxiv.2602.22817,
  title  = {Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks},
  author = {Shuo He and Lang Feng and Qi Wei and Xin Cheng and Lei Feng and Bo An},
  journal= {arXiv preprint arXiv:2602.22817},
  year   = {2026}
}

备注

Accepted at ICLR 2026