中文

使用无监督对齐探究深度神经网络与人类物体图像相似性判断之间的细粒度与粗粒度结构对应关系

计算机视觉与模式识别 2025-12-02 v1 人工智能

摘要

人类如何获得物体内部表征的学习机制尚未完全理解。深度神经网络(DNN)作为一种研究此问题的有用工具,因其内部表征类似于人类的表征是其目标函数优化的副产品。尽管已有研究表明,各种学习范例(如监督学习、自监督学习和 CLIP)训练的模型都获得了类似人类的表征,但其与人类表征的相似性主要是粗糙类别层面,还是延伸到更细致的细节仍不明确。本文采用基于 Gromov-Wasserstein 最优传输的无监督对齐方法,比较人类和模型物体表征在细粒度和粗粒度水平。与常规表征相似性分析方法相比,这种独特方法估计每个物体在人类和模型表征之间的最优细粒度映射。我们使用来自 THINGS 数据集的人类相似性判断(涵盖 1,854 个物体)评估了这种无监督对齐方法,衡量人类对每个物体表征是否正确映射到模型中对应物体的表征。结果表明,训练有 CLIP 的模型在细粒度和粗粒度匹配方面 consistently 实现了强劲的表现。相比之下,自监督模型在细粒度和粗粒度水平的匹配有限,但仍形成了反映人类粗糙类别结构的物体聚类。我们的结果为理解语言信息在获取精确物体表征中的作用,以及自监督学习在捕获粗粒度类别结构方面的潜力提供了新见解。

关键词

引用

@article{arxiv.2505.16419,
  title  = {Investigating Fine- and Coarse-grained Structural Correspondences Between Deep Neural Networks and Human Object Image Similarity Judgments Using Unsupervised Alignment},
  author = {Soh Takahashi and Masaru Sasaki and Ken Takeda and Masafumi Oizumi},
  journal= {arXiv preprint arXiv:2505.16419},
  year   = {2025}
}

备注

34 pages, 6 figures