中文

Steve-Eye:为开放世界中基于LLM的具身智能体配备视觉感知

计算机视觉与模式识别 2023-12-08 v2

摘要

近期研究提供了令人信服的证据,表明大型语言模型(LLMs)能够赋予具身智能体与世界交互的自驱动能力,这标志着迈向通用机器人的初步一步。然而,这些努力往往忽视了开放世界的视觉丰富性,使整个交互过程类似于“蒙眼基于文本的游戏”。因此,基于LLM的智能体经常难以直观理解周围环境并生成易于理解的响应。在本文中,我们提出Steve-Eye,一种端到端训练的大型多模态模型,旨在解决此局限。Steve-Eye将LLM与视觉编码器集成,使其能处理视觉-文本输入并生成多模态反馈。此外,我们采用半自动策略收集了包含85万条开放世界指令对的广泛数据集,使我们的模型涵盖智能体的三项基本功能:多模态感知、基础知识库以及技能预测与规划。最后,我们开发了三个开放世界评估基准,并从广泛视角开展大量实验以验证我们的模型在策略性行动与规划上的能力。代码与数据集将公开。

关键词

引用

@article{arxiv.2310.13255,
  title  = {Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds},
  author = {Sipeng Zheng and Jiazheng Liu and Yicheng Feng and Zongqing Lu},
  journal= {arXiv preprint arXiv:2310.13255},
  year   = {2023}
}

备注

19 pages, 19 figures