中文

面向 Minecraft 的强化学习友好型视觉-语言模型

机器学习 2024-08-06 v2 计算机视觉与模式识别

摘要

AI 研究界的一项核心使命是构建能够在广泛任务中实现高水平性能的自主具身智能体。然而,为所有开放式任务获取或手动设计奖励是不现实的。本文提出了一种新颖的跨模态对比学习框架架构 CLIP4MC,旨在学习强化学习(RL)友好型视觉-语言模型(VLM),作为开放式任务的内在奖励函数。简单利用视频片段和语言提示之间的相似度对 RL 并不友好,因为标准 VLM 可能仅能在粗粒度上捕捉相似度。为实现 RL 友好性,我们将任务完成度纳入 VLM 训练目标,因为该信息可帮助智能体区分不同状态间的重要性。此外,我们基于 MineDojo 提供的大规模 YouTube 数据库,提供了整洁的 YouTube 数据集。具体而言,两轮过滤操作保证了数据集涵盖足够的核心信息,且视频-文本对高度相关。实验表明,与基线相比,所提方法在 RL 任务上取得了更好的性能。代码和数据集可在 https://github.com/PKU-RL/CLIP4MC 获取。

关键词

引用

@article{arxiv.2303.10571,
  title  = {Reinforcement Learning Friendly Vision-Language Model for Minecraft},
  author = {Haobin Jiang and Junpeng Yue and Hao Luo and Ziluo Ding and Zongqing Lu},
  journal= {arXiv preprint arXiv:2303.10571},
  year   = {2024}
}

备注

ECCV 2024