ING-VP:多模态大语言模型尚未能玩转简单视觉游戏
计算与语言
2024-10-10 v1
摘要
随着多模态大语言模型(MLLMs)在广泛任务范围内不断展示越来越具竞争力的性能,开发越来越复杂和全面的基准测试以评估这些前沿模型也随之增多。这些基准测试为核心能力如感知、推理和规划带来了新挑战。然而,现有多模态基准测试不足以提供针对基于图像中空间关系的多步骤规划的聚焦评估。为填补这一差距,我们提出了ING-VP,即基于互动游戏的视觉规划基准测试,旨在评估MLLMs的空间想象和多步骤推理能力。ING-VP包含6个不同游戏,共300个关卡,每个关卡有6种 unique 配置。单个模型将进行超过60,000轮交互。基准框架允许多种比较设置,包括图像-文本 vs. 文本-only 输入、单步骤 vs. 多步骤 推理以及带历史记录 vs. 不带历史记录条件,为理解模型能力提供了宝贵洞见。我们评估了众多最先进的MLLMs,其中最佳-performing 模型Claude-3.5 Sonnet的平均准确率仅为3.37%,远低于预期的标准水平。本工作旨在提供一个专门的评估框架,以推动MLLMs在复杂空间推理和规划方面能力的提升。代码可在 https://github.com/Thisisus7/ING-VP.git 中公开获取。
引用
@article{arxiv.2410.06555,
title = {ING-VP: MLLMs cannot Play Easy Vision-based Games Yet},
author = {Haoran Zhang and Hangyu Guo and Shuyue Guo and Meng Cao and Wenhao Huang and Jiaheng Liu and Ge Zhang},
journal= {arXiv preprint arXiv:2410.06555},
year = {2024}
}
备注
49 pages, 12 figures