中文

视觉语言模型学习人类感知空间的几何结构

神经元与认知 2025-10-27 v1

摘要

在认知科学和人工智能中,一个长期存在的问题是机器是否学习到与人类心智对齐的表征。虽然当前模型显示出潜力,但这种对齐是表面的还是反映了表征底层维度上更深层次的对应关系,仍然是一个悬而未决的问题。在此,我们引入一种方法,通过让视觉语言模型(VLM)对一组复杂的自然物体生成成对相似性判断,来探测其内部几何结构。使用多维尺度分析,我们恢复了低维心理空间,并发现其轴与人类感知空间的主轴表现出强对应关系。关键的是,当这种源自AI的表征几何结构被用作经典分类范例模型的输入时,它比由人类判断本身构建的空间更能预测人类的分类行为。这表明VLM能够捕捉到人类感知结构的一种理想化或“去噪”形式。我们的工作提供了一种可扩展的方法来克服认知科学中的测量瓶颈,并证明了基础模型可以学习到一种表征几何结构,该结构在功能上与建模人类认知的关键方面(如分类)相关。

关键词

引用

@article{arxiv.2510.20859,
  title  = {Vision-language models learn the geometry of human perceptual space},
  author = {Craig Sanders and Billy Dickson and Sahaj Singh Maini and Robert Nosofsky and Zoran Tiganj},
  journal= {arXiv preprint arXiv:2510.20859},
  year   = {2025}
}