前沿LLM模型中意象推理的局限性
计算机视觉与模式识别
2026-03-31 v1 人工智能
摘要
大语言模型(LLM)已展现出令人印象深刻的推理能力,但它们在需要心理模拟的空间任务(如心理旋转)上仍存在困难。本文研究了为LLM配备外部「意象模块」——一种能够渲染和旋转3D模型的工具——是否可以弥合这一差距,充当「认知假体」。我们使用双模块架构进行了实验,其中推理模块(一个MLLM)与意象模块在3D模型旋转任务上交互。性能低于预期,准确率最高仅达到62.5%。进一步研究表明,即使将维护和操作整体3D状态的负担外包出去,系统仍然失败。这揭示了当前前沿模型缺乏与意象接口所需的视觉-空间基本原语。具体而言,它们缺乏:(1)提取空间信号(如(a)深度、(b)运动和(c)短时程动态预测)的低级敏感性;以及(2)对图像进行沉思性推理的能力,能够动态转移视觉焦点并在意象与符号和联想信息之间取得平衡。
引用
@article{arxiv.2603.26779,
title = {Limits of Imagery Reasoning in Frontier LLM Models},
author = {Sergio Y. Hayashi and Nina S. T. Hirata},
journal= {arXiv preprint arXiv:2603.26779},
year = {2026}
}
备注
25 pages