EgoPlan-Bench2:面向真实场景的多模态大语言模型规划基准
摘要
多模态大语言模型(Multimodal Large Language Models)的出现,借助大语言模型的强大能力,最近在多模态理解与推理方面展现出卓越的能力,开启了人工通用智能(AGI)的新时代。然而,实现 AGI 不仅需要理解与推理,更需要在多样化场景中进行有效规划,这涉及基于复杂环境做出合理决策以解决现实问题。尽管规划能力至关重要,但当前多模态大语言模型在不同场景中的规划能力仍鲜有探索。本文提出 EgoPlan-Bench2,一个严谨且全面的基准,用于评估多模态大语言模型在广泛真实场景中的规划能力。EgoPlan-Bench2 涵盖日常任务,跨越 4 大领域和 24 个详细场景,紧密对应人类日常生活。EgoPlan-Bench2 采用半自动化过程构建,利用以人身视角拍摄的视频,并辅以人工验证。基于第一人称视角,它镜像人类在日常生活中解决问题的方式。我们评估了 21 个竞争型多模态大语言模型,对其局限性进行深入分析,发现其在现实场景规划方面面临重大挑战。为进一步提升当前多模态大语言模型的规划能力,我们提出一种无需训练的做法,利用多模态链式思维(Chain-of-Thought, CoT)提示,通过探讨各种多模态提示在复杂规划中的有效性。我们的做法无需额外训练即可使 GPT-4V 在 EgoPlan-Bench2 上提升 10.24 分。我们的工作不仅阐明了多模态大语言模型在规划方面的当前局限,还为该关键领域的未来改进提供了启示。我们已在 https://qiulu66.github.io/egoplanbench2/ 上公开数据和代码。
引用
@article{arxiv.2412.04447,
title = {EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios},
author = {Lu Qiu and Yi Chen and Yuying Ge and Yixiao Ge and Ying Shan and Xihui Liu},
journal= {arXiv preprint arXiv:2412.04447},
year = {2025}
}
备注
Code & data are available at: https://qiulu66.github.io/egoplanbench2/