中文

基于视觉语言模型反馈的现实世界离线强化学习

机器人学 2025-08-07 v2 人工智能 机器学习

摘要

离线强化学习可以从预先收集的次优数据集中进行策略学习,而无需在线交互。这使其非常适合现实世界机器人和安全关键场景,在这些场景中收集在线数据或专家演示是缓慢、昂贵且危险的。然而,大多数现有的离线RL工作假设数据集已经用任务奖励进行了标注,这一过程通常需要大量的人工努力,特别是当真实状态难以确定时(例如在现实世界中)。在本文中,我们基于先前的工作,即RL-VLM-F,提出了一种新颖的系统,该系统利用视觉语言模型的偏好反馈和任务的文本描述自动为离线数据集生成奖励标签。然后,我们使用带有奖励标签的数据集,通过离线RL学习策略。我们展示了该系统在复杂的现实世界机器人辅助穿衣任务中的适用性,我们首先使用视觉语言模型在次优离线数据集上学习奖励函数,然后使用学到的奖励采用隐式Q学习来开发有效的穿衣策略。我们的方法在涉及刚体和可变形物体操作的模拟任务中也表现出色,并显著优于行为克隆和逆RL等基线方法。总结来说,我们提出了一种新系统,可以从无标注的次优离线数据集中实现自动奖励标注和策略学习。

关键词

引用

@article{arxiv.2411.05273,
  title  = {Real-World Offline Reinforcement Learning from Vision Language Model Feedback},
  author = {Sreyas Venkataraman and Yufei Wang and Ziyu Wang and Navin Sriram Ravie and Zackory Erickson and David Held},
  journal= {arXiv preprint arXiv:2411.05273},
  year   = {2025}
}

备注

7 pages. Accepted at the LangRob Workshop 2024 @ CoRL, 2024. Accepted at 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)