中文

GROW:将 GRPO 与状态-动作建模对齐用于开放世界 VLM 智能体

机器学习 2026-05-22 v2 人工智能

摘要

最近,视觉语言模型 (VLM) 智能体在开放世界任务中取得了显著进展,这类任务往往需要多轮视觉感知和动作执行。然而,现有方法仍主要依赖监督微调 (SFT) 配合专家演示,而先进的强化学习算法——尤其是组相对策略优化 (GRPO)——尚未被有效应用于此类任务的多轮强化学习,因为标准 GRPO 需要完整轨迹作为训练样本,导致上下文过长和噪声问题。为此,我们提出 GROW,一个用于开放世界 VLM 智能体的强化学习框架,通过将收集的轨迹分解为状态-动作样本,并在这些样本之间计算优势,而非将完整轨迹视为单个实体。我们进一步提供了代理分析,表明尽管分组样本基于不同的局部状态而非统一的提示上下文进行条件化,目标函数仍可保留 GRPO 的核心相对策略优化信号。实验在超过 800 个 Minecraft 任务上表明,我们的方法实现了最先进 (SOTA) 的性能,证明了该 RL 框架在开放世界 VLM 智能体中的有效性。

关键词

引用

@article{arxiv.2605.20246,
  title  = {GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents},
  author = {Xiongbin Wu and Zhihao Luo and Shanzhe Lei and Lechao Zhang and Xuhong Wang and Jie Yang and Zhonglong Zheng and Yuanjie Zheng and Xin Tan and Wei Liu},
  journal= {arXiv preprint arXiv:2605.20246},
  year   = {2026}
}