中文

视觉-语言模型在点与点击拼图游戏中是否展现出类人逻辑问题解决能力?

人工智能 2026-05-19 v2

摘要

视觉-语言(-动作)模型(VLMs)日益应用于交互式环境,但现有基准常常忽视点与点击拼图游戏所需的复杂物理推理。本文引入视觉-语言对抗巨型机械(VLATIM),一个旨在评估经典物理拼图游戏《巨型机械2号》(TIM)中类人逻辑问题解决能力的基准。与现有基准不同,VLATIM 特别针对高级逻辑推理与需要精确鼠标交互的连续动作空间之间的关键差距进行设计。该基准分为五个递进阶段,评估范围从基本的视觉锚定和领域理解,到多步骤操作和完整拼图求解。我们的结果揭示了推理与执行之间的显著差距。虽然大型专有模型在规划方面表现优越,但在精确的视觉锚定方面仍感到困难。因此,他们尚未展现出类人问题解决能力。

关键词

引用

@article{arxiv.2605.11223,
  title  = {Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?},
  author = {Maximilian Triebel and Marco Menner and Dominik Helfenstein},
  journal= {arXiv preprint arXiv:2605.11223},
  year   = {2026}
}