通过多模态大语言模型实现端到端具身决策:基于GPT4-Vision及后续的探索
人工智能
2023-11-29 v4 计算与语言
计算机视觉与模式识别
机器人学
摘要
在本研究中,我们探索多模态大语言模型(MLLMs)在提升智能体具身决策过程中的潜力。尽管大语言模型(LLMs)因其高级推理能力与广博世界知识已被广泛使用,但如GPT4-Vision之类的MLLMs提供了增强的视觉理解与推理能力。我们考察最先进的MLLMs能否以端到端方式处理具身决策,以及LLMs与MLLMs的协作能否增强决策。为回答这些问题,我们引入称为PCA-EVAL的新基准,从感知、认知与行动角度评估具身决策。此外,我们提出HOLMES——一种多智能体协作框架,使LLMs能利用MLLMs与API收集多模态信息以进行知情决策。我们在基准上比较端到端具身决策与HOLMES,发现GPT4-Vision模型展现出强大的端到端具身决策能力,平均决策准确率优于GPT4-HOLMES(+3%)。然而,此性能仅限最新的GPT4-Vision模型,其超越开源最先进MLLM达26%。我们的结果表明,诸如GPT4-Vision的强大MLLMs在具身智能体决策方面具有前景,为MLLM研究提供了新途径。代码与数据开源于 https://github.com/pkunlp-icler/PCA-EVAL/。
引用
@article{arxiv.2310.02071,
title = {Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond},
author = {Liang Chen and Yichi Zhang and Shuhuai Ren and Haozhe Zhao and Zefan Cai and Yuchi Wang and Peiyi Wang and Tianyu Liu and Baobao Chang},
journal= {arXiv preprint arXiv:2310.02071},
year = {2023}
}
备注
FMDM@NeurIPS2023, Code and data: https://github.com/pkunlp-icler/PCA-EVAL/