中文

GTR:引导式思维强化防止基于强化学习的视觉语言模型智能体训练中的思维坍缩

计算机视觉与模式识别 2025-07-14 v2 人工智能

摘要

基于可验证结果奖励的强化学习(RLVR)已有效扩展了大语言模型(LLM)中的思维链(CoT)推理。然而,其在训练视觉语言模型(VLM)智能体进行视觉环境中有目标导向的动作推理方面的有效性尚未得到充分验证。本文通过在复杂纸牌游戏(如24点)和ALFWorld中的具身任务上进行大量实验来研究这一问题。我们发现,当奖励仅基于动作结果时,强化学习无法激励VLM中的CoT推理,反而导致一种我们称之为思维坍缩的现象,其特征是智能体思维的快速多样性丧失、与状态无关且不完整的推理,以及随后产生的无效动作,从而导致负奖励。为对抗思维坍缩,我们强调了过程引导的必要性,并提出了一种自动校正器,用于在每一步强化学习中评估和优化智能体的推理。这种简单且可扩展的GTR(引导式思维强化)框架同时训练推理和动作,无需密集的逐步骤人工标注。我们的实验表明,GTR显著提升了LLaVA-7b模型在各种视觉环境中的性能和泛化能力,与现有最优模型相比,在模型规模明显更小的情况下实现了3-5倍更高的任务成功率。

关键词

引用

@article{arxiv.2503.08525,
  title  = {GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training},
  author = {Tong Wei and Yijun Yang and Junliang Xing and Yuanchun Shi and Zongqing Lu and Deheng Ye},
  journal= {arXiv preprint arXiv:2503.08525},
  year   = {2025}
}

备注

Accepted by ICCV 2025