MentisOculi: 揭示运用心理图像推理的极限
人工智能
2026-02-03 v1 计算机视觉与模式识别
机器学习
摘要
前沿模型正从仅接收视觉信息的多模态大语言模型 (MLLM) 向具备原生交叉生成能力的统一多模态模型 (UMM) 转变。这一转变催生了使用中间可视化作为推理辅助的兴趣,类似于人类心理图像。核心在于能够以目标导向方式形成、维持和操作视觉表征。为评估和探索这一能力,我们开发 MentisOculi,一个程序化、分层的多步骤推理问题集合,适合可视化求解,旨在挑战前沿模型。评估从潜在标记到显式生成图像的各种视觉策略,我们发现它们通常未能提升性能。针对 UMM 的分析暴露出关键局限性:尽管它们具备解决任务的文本推理能力且有时能生成正确的视觉表征,但因累积生成错误而未能利用即使是真实的可视化。我们的发现表明,尽管其内在吸引力显而易见,视觉思维目前尚不利于模型推理。MentisOculi 为在不同模型家族中分析和弥合这一鸿沟奠定了必要基础。
引用
@article{arxiv.2602.02465,
title = {MentisOculi: Revealing the Limits of Reasoning with Mental Imagery},
author = {Jana Zeller and Thaddäus Wiedemer and Fanfei Li and Thomas Klein and Prasanna Mayilvahanan and Matthias Bethge and Felix Wichmann and Ryan Cotterell and Wieland Brendel},
journal= {arXiv preprint arXiv:2602.02465},
year = {2026}
}
备注
9 pages, 8 figures