Hyperphantasia:评估多模态大语言模型心理可视化能力的基准
计算机视觉与模式识别
2026-01-22 v2
摘要
心理可视化是构建和操控内部视觉表征的能力,是人类认知的核心组成部分,在推理、预测和抽象等任务中发挥关键作用。尽管多模态大语言模型(MLLM)取得了快速进展,当前基准主要评估被动视觉感知,难以洞察更主动的内部构建视觉图案以支持问题解决的能力。然而,心理可视化是人类认知中的关键技能,支持空间导航、预测物理轨迹和通过想象性模拟解决复杂视觉问题。为填补这一差距,我们引入Hyperphantasia,一个通过四个精心设计的谜题评估MLLM心理可视化能力的合成基准。每个谜题都按程序生成,并提供三个难度级别,实现对模型性能在递增复杂度下的受控分析。我们对最新模型进行全面评估,发现人类与MLLM之间存在显著差距。此外,我们探索了利用强化学习改进视觉模拟能力的潜力。我们的发现表明,尽管某些模型在识别视觉图案方面表现出部分能力,但鲁棒的心理可视化仍是当前MLLM的开放挑战。
引用
@article{arxiv.2507.11932,
title = {Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs},
author = {Mohammad Shahab Sepehri and Berk Tinaz and Zalan Fabian and Mahdi Soltanolkotabi},
journal= {arXiv preprint arXiv:2507.11932},
year = {2026}
}