中文

EscapeCraft:用于基准测试复杂多模态推理能力的 3D 房间逃脱环境

计算机视觉与模式识别 2025-06-05 v4

摘要

多模态大语言模型(MLLMs)的快速发展激发了对现实世界和虚拟环境中复杂多模态推理任务的兴趣,这些任务需要协调多种能力,包括视觉感知、视觉推理、空间意识和目标推断。然而,现有评估主要评估最终任务完成情况,往往将评估降级为孤立的视觉定位和视觉问答等能力。对多模态环境中推理过程的全面和定量分析关注较少,这对于理解模型行为和底层推理机制至关重要,而不仅仅是任务成功。为解决这一问题,我们引入了 MM-Escape,一个用于研究多模态推理的可扩展基准,灵感来源于现实世界中的密室逃脱游戏。MM-Escape 强调中间模型行为以及最终任务完成情况。为此,我们开发了 EscapeCraft,一个可定制且开放的环境,使模型能够进行自由探索以评估多模态推理能力。大量实验表明,MLLMs 无论规模大小,都能成功完成最简单的房间逃脱任务,其中一些表现出类似人类的探索策略。然而,随着任务难度的增加,性能急剧下降。此外,我们观察到性能瓶颈因模型而异,揭示了它们在多模态推理能力方面的不同失败模式和局限性,例如缺乏自适应探索的重复轨迹、因视觉空间意识差而卡在角落,以及对获取的道具(如钥匙)的无效使用。我们希望我们的工作揭示了多模态推理中的新挑战,并发现了 MLLMs 能力的潜在改进方向。

关键词

引用

@article{arxiv.2503.10042,
  title  = {EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability},
  author = {Ziyue Wang and Yurui Dong and Fuwen Luo and Minyuan Ruan and Zhili Cheng and Chi Chen and Peng Li and Yang Liu},
  journal= {arXiv preprint arXiv:2503.10042},
  year   = {2025}
}