通过视觉语言模型从目标条件化到语言条件化智能体
人工智能
2024-11-27 v2
摘要
视觉语言模型(VLMs)在对语言进行 grounding方面具有巨大的潜力,从而使语言条件化智能体(LCAs)能够执行以文本指定的多样化任务。这就激发了基于强化学习(RL)的LCAs研究,奖励来自于渲染环境图像并由VLMs评估。若采用单任务RL,这类方法受限于为每个新任务训练策略的成本和时间。多任务RL(MTRL)是一种自然替代方案,但需要精心设计的训练任务语料库,并且不总能可靠地推广到新任务。因此,本文提出了一种新的LCAs构建问题的 novel 分解:首先找到一个VLM评分高的环境配置,用于描述该任务的文本;然后使用(预训练的)目标条件化策略以到达该配置。我们还探索了几种提高VLM-based LCAs速度和质量的措施,尤其是使用蒸馏模型以及从多个视角评估配置以解决单一2D视图固有的歧义。我们在Humanoid环境上演示了我们的方案,表明它能够在无需任何文本任务描述或其他形式的环境特定标注的情况下,以零样本方式优于MTRL基线进行generalization。视频和交互演示可在https://europe.naverlabs.com/text2control 找到。
引用
@article{arxiv.2409.16024,
title = {From Goal-Conditioned to Language-Conditioned Agents via Vision-Language Models},
author = {Theo Cachet and Christopher R. Dance and Olivier Sigaud},
journal= {arXiv preprint arXiv:2409.16024},
year = {2024}
}