视觉-语言模型作为奖励来源
机器学习
2024-07-16 v3
摘要
构建能够在丰富的开放环境中实现许多目标的通用智能体是强化学习的研究前沿之一。用强化学习构建通用智能体的一个关键限制因素是需要大量奖励函数来实现不同目标。我们研究了使用现成的视觉-语言模型(VLM)作为强化学习智能体奖励来源的可行性。我们展示了如何从CLIP系列模型中推导出实现各种语言目标的视觉成就奖励,并用于训练能够实现各种语言目标的强化学习智能体。我们在两个不同的视觉领域展示了这种方法,并呈现了一个缩放趋势:更大的VLM能产生更准确的视觉目标成就奖励,进而产生更强大的强化学习智能体。
引用
@article{arxiv.2312.09187,
title = {Vision-Language Models as a Source of Rewards},
author = {Kate Baumli and Satinder Baveja and Feryal Behbahani and Harris Chan and Gheorghe Comanici and Sebastian Flennerhag and Maxime Gazeau and Kristian Holsheimer and Dan Horgan and Michael Laskin and Clare Lyle and Hussain Masoom and Kay McKinney and Volodymyr Mnih and Alexander Neitz and Dmitry Nikulin and Fabio Pardo and Jack Parker-Holder and John Quan and Tim Rocktäschel and Himanshu Sahni and Tom Schaul and Yannick Schroecker and Stephen Spencer and Richie Steigerwald and Luyu Wang and Lei Zhang},
journal= {arXiv preprint arXiv:2312.09187},
year = {2024}
}
备注
10 pages, 5 figures