中文

视觉大型语言模型在威斯康星卡片分类测试中展现出人类水平的认知灵活性

人工智能 2025-05-29 v1 神经元与认知

摘要

认知灵活性在人类认知中已被广泛研究,但在视觉大型语言模型的背景下仍相对未被探索。本研究使用威斯康星卡片分类测试(WCST)这一衡量定势转换能力的经典工具,评估了最先进的 VLLMs(GPT-4o、Gemini-1.5 Pro 和 Claude-3.5 Sonnet)的认知灵活性。我们的结果显示,在基于文本输入的思维链提示下,VLLMs 达到或超越了人类水平的定势转换能力。然而,它们的能力受输入模态和提示策略的影响极大。此外,我们发现通过角色扮演,VLLMs 能够模拟与认知灵活性受损患者一致的各种功能缺陷,这表明 VLLMs 可能具备一种认知架构(至少在定势转换能力方面)类似于人脑。这项研究揭示了 VLLMs 在我们高级认知的关键组成部分上已经接近人类水平,并强调了利用它们来模拟复杂大脑过程的潜力。

关键词

引用

@article{arxiv.2505.22112,
  title  = {Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test},
  author = {Guangfu Hao and Frederic Alexandre and Shan Yu},
  journal= {arXiv preprint arXiv:2505.22112},
  year   = {2025}
}