视觉-语言模型是强化学习的零样本奖励模型
机器学习
2024-03-15 v2 人工智能
摘要
强化学习(RL)要么需要手动指定奖励函数(这通常不可行),要么需要从大量人类反馈中学习奖励模型(这通常非常昂贵)。我们研究一种更具样本效率的替代方案:使用预训练视觉-语言模型(VLMs)作为零样本奖励模型(RMs),通过自然语言指定任务。我们提出一种自然且通用的将 VLMs 用作奖励模型的方法,称为 VLM-RMs。我们使用基于 CLIP 的 VLM-RMs 训练 MuJoCo 人形机器人学习复杂任务而无需手动指定奖励函数,如跪下、劈叉和盘腿而坐。对每个任务,我们仅提供一句描述所需任务的文本提示,且极少提示工程。训练智能体的视频见:https://sites.google.com/view/vlm-rm。我们通过提供第二个“基线”提示并投影出 CLIP 嵌入空间中与区分目标与基线无关的部分来提升性能。此外,我们发现 VLM-RMs 存在强烈的规模效应:以更多算力和数据训练的大型 VLMs 是更好的奖励模型。我们遇到的 VLM-RMs 失败模式均与当前 VLMs 已知的能力局限相关,如有限的空间推理能力或远离 VLM 分布的可视不真实环境。我们发现只要 VLM 足够大,VLM-RMs 就异常鲁棒。这表明未来 VLMs 将成为越来越多 RL 应用的有用奖励模型。
引用
@article{arxiv.2310.12921,
title = {Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning},
author = {Juan Rocamonde and Victoriano Montesinos and Elvis Nava and Ethan Perez and David Lindner},
journal= {arXiv preprint arXiv:2310.12921},
year = {2024}
}
备注
Presented at International Conference on Learning Representations (ICLR) 2024