JARVIS-1:具备记忆增强多模态语言模型的开放世界多任务智能体
人工智能
2023-12-01 v3
摘要
在开放世界中利用多模态观测实现类人的规划与控制,是迈向更具功能性的通用智能体的关键里程碑。现有方法能够处理开放世界中的某些长视野任务。然而,当开放世界任务的数量可能趋于无穷时,它们仍举步维艰,并且缺乏随着游戏时间推进逐步增强任务完成能力的特点。我们提出JARVIS-1,一个开放世界智能体,它能在广受欢迎却极具挑战性的开放世界Minecraft宇宙中感知多模态输入(视觉观测与人类指令)、生成复杂计划并执行具身控制。具体而言,我们在预训练多模态语言模型之上开发JARVIS-1,该模型将视觉观测与文本指令映射为计划。这些计划最终被分派给目标条件控制器。我们为JARVIS-1配备了一个多模态记忆,它利用预训练知识与真实游戏生存经验辅助规划。JARVIS-1是现有Minecraft中最通用的智能体,能够使用与人类相似的控制与观测空间完成超过200种不同的任务。这些任务涵盖从短视野任务(如“砍树”)到长视野任务(如“获得钻石镐”)。JARVIS-1在短视野任务中表现极为出色,近乎完美。在经典的长期任务中,JARVIS-1的可靠性超越当前最先进(SOTA)智能体5倍,并能成功完成更长视野且更具挑战性的任务。项目页面见 https://craftjarvis.org/JARVIS-1
引用
@article{arxiv.2311.05997,
title = {JARVIS-1: Open-World Multi-task Agents with Memory-Augmented Multimodal Language Models},
author = {Zihao Wang and Shaofei Cai and Anji Liu and Yonggang Jin and Jinbing Hou and Bowei Zhang and Haowei Lin and Zhaofeng He and Zilong Zheng and Yaodong Yang and Xiaojian Ma and Yitao Liang},
journal= {arXiv preprint arXiv:2311.05997},
year = {2023}
}
备注
update project page