基于视觉 grounding 的目标级泛化强化学习
人工智能
2024-08-06 v1 计算机视觉与模式识别
摘要
泛化是遵循自然语言指令的智能体面临的关键挑战之一。为解决此问题,我们利用视觉语言模型(VLM)进行视觉 grounding,并将其视觉语言知识转化为强化学习(RL)中的目标导向任务,使智能体能够对未见到的目标和指令实现零样本泛化。通过视觉 grounding,我们获得针对指令中指示目标的目标 grounding 置信度图。基于此置信度图,我们提出了两种将VLM知识转化为RL的方法。首先,我们提出一种从置信度图中派生的目标 grounding 内在奖励函数,以更有效地引导智能体前往目标。其次,置信度图为智能体的策略提供了更统一、更易访问的任务表示,相较于语言嵌入,使智能体能够通过可理解的视觉置信度图处理未见到的目标和指令,从而实现零样本目标级泛化。单任务实验表明,我们的内在奖励显著改善了在挑战性技能学习任务上的性能。在多任务实验中,我们通过测试超出训练集的任务,展示了在提供置信度图作为任务表示的情况下,智能体比基于语言的条件化在零样本目标级泛化方面具有更好的性能。代码已公开于https://github.com/PKU-RL/COPL。
引用
@article{arxiv.2408.01942,
title = {Visual Grounding for Object-Level Generalization in Reinforcement Learning},
author = {Haobin Jiang and Zongqing Lu},
journal= {arXiv preprint arXiv:2408.01942},
year = {2024}
}
备注
35 pages, 14 figures, 17 tables