从像素到 BFS:高精度迷宫导航不等于视觉规划
机器学习
2026-05-14 v2 计算机视觉与模式识别
摘要
多模态模型是通过真正的规划,还是通过在 token 空间中进行暴力搜索来解决视觉空间任务的?我们引入 \textsc{MazeBench},一个包含 110 个程序生成迷宫图像的基准数据集,覆盖九个受控组,并评估了来自 OpenAI、Anthropic、Google 和 Alibaba 的 16 种模型配置。GPT-5.4 解答 91%,Gemini 3.1 Pro 解答 79%,但这些分数具有误导性:模型通常将图像转换为文本网格,然后逐步枚举路径,每题消耗 1,710--22,818 个 token,而人类则快速完成。若不添加推理预算,所有配置仅得 2--12%;在 20×20 超难迷宫上,模型触及 token 限制而失败。定性轨迹揭示常见的两阶段策略:图像到网格转换 followed by token 级搜索,实际上是文本中的 BFS。文本网格消除实验证明,Claude Sonnet 在图像上得分仅 6%,而给定正确网格后提升至 80%,从而隔离了弱视觉抽取与下游搜索的影响。即使明确指示不要构建网格或执行图搜索,模型仍回归到相同的枚举策略。\textsc{MazeBench} 表明,视觉规划任务的高准确率并不等于人类式的空间理解。
引用
@article{arxiv.2603.26839,
title = {From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning},
author = {Alberto G. Rodriguez Salgado},
journal= {arXiv preprint arXiv:2603.26839},
year = {2026}
}
备注
15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes