中文

MFE-ETP:面向具身任务规划的多模态基础模型综合评估基准

人工智能 2024-10-08 v3

摘要

近年来,多模态基础模型和具身人工智能以前所未有的速度齐头并进。两者的结合引起了人工智能研究界的广泛关注。在这项工作中,我们试图对MFM在具身任务规划上的表现进行深入和全面的评估,旨在揭示它们在该领域的能力和局限性。为此,基于具身任务规划的特点,我们首先开发了一个系统评估框架,该框架囊括了MFM的四个关键能力:物体理解、时空感知、任务理解和具身推理。随后,我们提出了一个新的基准,名为MFE-ETP,其特点是复杂多变的任务场景、典型且多样的任务类型、不同难度的任务实例,以及从多种具身问答到具身任务推理的丰富测试用例类型。最后,我们提供了一个简单易用的自动评估平台,能够对提出的基准上的多个MFM进行自动测试。利用该基准和评估平台,我们评估了几个最先进的MFM,发现它们显著落后于人类水平的表现。MFE-ETP是一个高质量、大规模且具有挑战性的基准,与现实世界任务相关。

关键词

引用

@article{arxiv.2407.05047,
  title  = {MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning},
  author = {Min Zhang and Xian Fu and Jianye Hao and Peilong Han and Hao Zhang and Lei Shi and Hongyao Tang and Yan Zheng},
  journal= {arXiv preprint arXiv:2407.05047},
  year   = {2024}
}