中文

GoalLadder:基于视觉语言模型的增量目标发现

机器学习 2025-12-15 v2

摘要

自然语言可以为指定强化学习(RL)任务提供简洁且人类可解释的表述方式。从语言指令中提取奖励的能力可以开发出能够从人类指导中学习的机器人系统;然而,这在视觉环境中仍是一个具有挑战性的问题。现有方法要么依赖非视觉环境表征,要么需要大量反馈,或生成噪声且结构不良的奖励函数。在本文中,我们提出了一种新方法 GoalLadder,通过利用视觉语言模型(VLM)在视觉环境中从单条语言指令训练 RL 智能体。GoalLadder 通过逐步发现接近完成由自然语言指定任务的状态来工作。为此,它查询 VLM 以识别表示智能体任务进步改善的状态,并进行两两比较来对其进行排序。与旁有方法不同,GoalLadder 并不完全信任 VLM 的反馈,而是通过基于 ELO 评分系统对潜在目标状态进行排序,从而减少噪声 VLM 反馈的负面影响。在训练期间,智能体被要求最小化到学习嵌入空间中顶部排序目标的距离,而该嵌入空间是在无标签视觉数据上训练的。这一关键特性使我们无需通常需要的大量准确反馈即可训练良型奖励函数。我们在经典控制和机器人操纵环境中证明 GoalLadder 优于现有相关方法,最终成功率平均约为 95%,而最佳竞争者仅约为 45%。

关键词

引用

@article{arxiv.2506.16396,
  title  = {GoalLadder: Incremental Goal Discovery with Vision-Language Models},
  author = {Alexey Zakharov and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2506.16396},
  year   = {2025}
}

备注

NeurIPS 2025