中文

计算机视觉模型显示类人对几何和拓扑概念的敏感性

计算机视觉与模式识别 2025-05-20 v1

摘要

随着机器学习 (ML) 模型的快速进步,认知科学家们日益关注这些模型是否与人类思维方式相吻合。本文聚焦于计算机视觉模型与人类对几何和拓扑 (GT) 概念敏感性的关系。在核心知识论 (core knowledge account) 的观点下,这些概念是先天的,并受专门神经电路的支持。本文则探讨另一种解释,即通过日常与环境的互动,GT概念是以“零成本”方式学习得到的。我们采用计算机视觉模型,这些模型是在大规模图像数据集上进行训练的。我们在此基础上,借助前期研究,探讨了三类模型——卷积神经网络 (CNNs)、基于变换器的模型和视觉-语言模型——在测试43个覆盖七个类别的GT概念的“找不同”任务中的整体表现和人类对齐情况。变换器基模型实现了最高的整体准确率,超越了幼儿童的表现。它们还显示出与儿童表现的强烈对齐,发现相同类别的概念易于与困难相关联。相比之下,视觉-语言模型在视觉专用模型方面的表现不足,并与人类配置相距甚远,这表明,单纯的多模态性可能会损害抽象几何敏感性。我们的发现支持将计算机视觉模型用于评估学习论证解释人类GT概念敏感性的充分性,同时也表明,整合语言和视觉表征可能带来意想不到的负面后果。

关键词

引用

@article{arxiv.2505.13281,
  title  = {Computer Vision Models Show Human-Like Sensitivity to Geometric and Topological Concepts},
  author = {Zekun Wang and Sashank Varma},
  journal= {arXiv preprint arXiv:2505.13281},
  year   = {2025}
}

备注

10 pages, 4 figures, CosSci 2025