中文

通过变分子目标条件强化学习推进自主视觉语言模型智能体

机器学习 2025-05-22 v2 人工智能

摘要

最先进 (SOTA) 的强化学习 (RL) 方法已使视觉语言模型 (VLM) 智能体能够从与在线环境的交互中无需人类监督地学习。然而,这些方法在应用于具有稀疏奖励和长期依赖关系的复杂现实决策任务时,常常面临学习效率不足的问题。我们提出一种新框架,变分子目标条件强化学习 (VSC-RL),推进 VLM 智能体解决具有挑战性的决策任务。根本上与现有方法不同,VSC-RL 将决策问题重新表述为变分子目标条件 RL 问题,推导出新的优化目标——子目标证据下界 (SGC-ELBO),该目标包含两个关键组成部分:(a)最大化子目标条件回报,和 (b)最小化与参考目标条件策略之间的偏差。我们在理论和实证方面证明,VSC-RL 在不损害性能保证的前提下,能够有效提升学习效率。在一系列具有挑战性的基准测试中,包括移动设备和网页控制任务,VSC-RL 一致优于现有 SOTA 方法,实现了卓越的学习效率和性能。

关键词

引用

@article{arxiv.2502.07949,
  title  = {Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning},
  author = {Qingyuan Wu and Jianheng Liu and Jianye Hao and Jun Wang and Kun Shao},
  journal= {arXiv preprint arXiv:2502.07949},
  year   = {2025}
}