VAGEN:强化世界模型推理的多轮视觉语言模型智能体
人工智能
2025-10-21 v1 计算与语言
摘要
与语言模型(LLM)智能体相比,视觉语言模型(VLM)智能体面临的关键挑战在于从文本状态转向复杂的视觉观察,这会引入部分可观测性,要求构建鲁棒的世界模型。我们提出的问题是:VLM 智能体能否通过显式的视觉状态推理来构建内部世界模型?为回答此问题,我们通过强化学习(RL)对代理的推理过程进行架构性强制和奖励,将其形式化为部分可观测马尔可夫决策过程(POMDP)。我们发现,将代理的推理分解为状态估计(“当前状态是什么?”)和转移建模(“接下来会是什么?”)对于成功至关重要,这通过五种推理策略得以证明。我们的调查揭示了代理如何表示内部信念的问题,最佳表示取决于具体任务:自然语言在捕捉一般任务中的语义关系方面表现出色,而结构化格式在精确的操控和控制中不可或缺。基于这些见识,我们设计了世界模型奖励,以提供针对准确状态预测的稠密、轮次级监督,并引入双层通用优势估计(Bi-Level GAE)用于轮次感知的信用分配。通过这种视觉状态推理,30 亿参数的模型在五个多样化智能体基准测试中取得 0.82 的分数,显著超过其未训练的对手(0.21),并优于专有推理模型,如 GPT-5(0.75)、Gemini 2.5 Pro(0.67)和 Claude 4.5(0.62)。所有实验均在我们的 VAGEN 框架内进行,该框架是一个面向多轮 VLM 智能体在多样化视觉环境中进行训练和分析的可扩展系统。代码和数据已公开于 https://vagen-ai.github.io。
引用
@article{arxiv.2510.16907,
title = {VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents},
author = {Kangrui Wang and Pingyue Zhang and Zihan Wang and Yaning Gao and Linjie Li and Qineng Wang and Hanyang Chen and Chi Wan and Yiping Lu and Zhengyuan Yang and Lijuan Wang and Ranjay Krishna and Jiajun Wu and Li Fei-Fei and Yejin Choi and Manling Li},
journal= {arXiv preprint arXiv:2510.16907},
year = {2025}
}
备注
Accepted to NeurIPS 2025