中文

通过多模态大语言模型实现端到端具身决策:基于GPT4-Vision及后续的探索

人工智能 2023-11-29 v4 计算与语言 计算机视觉与模式识别 机器人学

摘要

在本研究中,我们探索多模态大语言模型(MLLMs)在提升智能体具身决策过程中的潜力。尽管大语言模型(LLMs)因其高级推理能力与广博世界知识已被广泛使用,但如GPT4-Vision之类的MLLMs提供了增强的视觉理解与推理能力。我们考察最先进的MLLMs能否以端到端方式处理具身决策,以及LLMs与MLLMs的协作能否增强决策。为回答这些问题,我们引入称为PCA-EVAL的新基准,从感知、认知与行动角度评估具身决策。此外,我们提出HOLMES——一种多智能体协作框架,使LLMs能利用MLLMs与API收集多模态信息以进行知情决策。我们在基准上比较端到端具身决策与HOLMES,发现GPT4-Vision模型展现出强大的端到端具身决策能力,平均决策准确率优于GPT4-HOLMES(+3%)。然而,此性能仅限最新的GPT4-Vision模型,其超越开源最先进MLLM达26%。我们的结果表明,诸如GPT4-Vision的强大MLLMs在具身智能体决策方面具有前景,为MLLM研究提供了新途径。代码与数据开源于 https://github.com/pkunlp-icler/PCA-EVAL/。

关键词

引用

@article{arxiv.2310.02071,
  title  = {Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond},
  author = {Liang Chen and Yichi Zhang and Shuhuai Ren and Haozhe Zhao and Zefan Cai and Yuchi Wang and Peiyi Wang and Tianyu Liu and Baobao Chang},
  journal= {arXiv preprint arXiv:2310.02071},
  year   = {2023}
}

备注

FMDM@NeurIPS2023, Code and data: https://github.com/pkunlp-icler/PCA-EVAL/