构成性失能:可指令化视觉语言模型的意外限制及其对人类认知障碍的类比
计算机视觉与模式识别
2024-10-07 v1 人工智能
人机交互
摘要
本研究揭示了可指令化视觉语言模型(VLMs)与人类认知障碍,specifically constructive apraxia 之间的意外相似性。我们测试了25个最先进的VLMs,包括GPT-4 Vision、DALL-E 3和Midjourney v5,其在生成庞佐错觉图像方面的能力,该任务需要基本的空间推理,常用于临床评估构成性失能。惊人的是,24个模型未能正确呈现两个水平线,背景为透视图案,类似于棘手 lobe 损伤患者的缺陷。模型一致地误解了空间指令,产生倾斜或错位的线条,Follow 背景的透视。这种行为 strikingly 类似于失能患者在复制或构建简单图形时所 struggle,尽管视觉感知和运动技能完好。我们的发现表明,尽管当前VLMs在其他领域具有先进能力,但缺乏基本的空间推理能力,这类似于构成性失能中所见的缺陷。这一局限为研究空间认知缺陷提供了新的计算模型,突显了VLMs架构和训练方法的关键改进领域。
引用
@article{arxiv.2410.03551,
title = {Constructive Apraxia: An Unexpected Limit of Instructible Vision-Language Models and Analog for Human Cognitive Disorders},
author = {David Noever and Samantha E. Miller Noever},
journal= {arXiv preprint arXiv:2410.03551},
year = {2024}
}