MMRo:多模态大语言模型是否适合作为居家机器人的大脑?
机器人学
2024-07-01 v1 计算机视觉与模式识别
摘要
机器人作为人类环境中的有用助手 fundamentally 需要解决机器人学中的诸多子问题,包括感知、语言理解、推理和规划。近期来,多模态大语言模型(Multimodal Large Language Models, MLLMs)在解决复杂数学问题、掌握常识和抽象推理方面显示出卓越的能力。这导致 MLLMs 最近被用作机器人系统的大脑,使其能够在触发低层控制动作执行任务之前进行高层规划。然而,现存 MLLMs 在作为机器人大脑方面是否可靠尚不明确。本研究引入了首个评估多模态大语言模型用于机器人(MMRo)基准测试,该测试评估 MLLMs 具备机器人应用所必需的能力。具体而言,我们确定了感知、任务规划、视觉推理和安全测量四项本领,使 MLLMs 具备资格作为机器人的中央处理单元。我们为每项本领开发了多个情景,总计14项指标进行评估。我们呈现了各种 MLLMs(包括商业和开源模型)的实验结果,以评估现有系统的性能。我们的发现表明,没有单个模型在所有领域都表现出色,这表明当前 MLLMs 尚不够可靠,无法作为机器人的认知核心。我们的数据可在 https://mm-robobench.github.io/ 查找。
引用
@article{arxiv.2406.19693,
title = {MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?},
author = {Jinming Li and Yichen Zhu and Zhiyuan Xu and Jindong Gu and Minjie Zhu and Xin Liu and Ning Liu and Yaxin Peng and Feifei Feng and Jian Tang},
journal= {arXiv preprint arXiv:2406.19693},
year = {2024}
}