中文

看与想:虚拟环境中的具身智能体

人工智能 2024-07-10 v3

摘要

大语言模型(LLMs)在若干开放世界任务上取得了令人印象深刻的进展。近来,使用 LLMs 构建具身智能体已成为一个热点。本文提出 STEVE,一个在 Minecraft 虚拟环境中全面且具有前瞻性的具身智能体。STEVE 包含三个关键组件:视觉感知、语言指令和代码动作。视觉感知涉及解释环境中的视觉信息,随后将其与智能体状态和任务指令一起整合进 LLMs 组件。语言指令负责迭代推理并将复杂任务分解为可管理的指导。代码动作基于技能数据库中的检索生成可执行技能动作,使智能体能够在 Minecraft 环境中有效交互。我们还收集了 STEVE-21K 数据集,包含 600+ 视觉-环境对、20K 知识问答对和 200+ 技能-代码对。我们进行了连续方块搜索、知识问答和技术树掌握以评估性能。大量实验表明,STEVE 在解锁关键技术树上最多快 1.5 倍,在方块搜索任务中快 2.5 倍。

关键词

引用

@article{arxiv.2311.15209,
  title  = {See and Think: Embodied Agent in Virtual Environment},
  author = {Zhonghan Zhao and Wenhao Chai and Xuan Wang and Li Boyi and Shengyu Hao and Shidong Cao and Tian Ye and Gaoang Wang},
  journal= {arXiv preprint arXiv:2311.15209},
  year   = {2024}
}

备注

ECCV 2024. First three authors contribute equally to this work. Project Website https://rese1f.github.io/STEVE/