视觉与语言表征在感知相似性的共享、多维空间中收敛
神经元与认知
2025-07-30 v1 机器学习
摘要
人类能够轻松描述所见内容,但在建立视觉与语言之间的共享表征格式方面仍面临重大挑战。新近的证据表明,人类脑中视觉和语言表征均可被大规模语言模型(LLM)获取的语义特征空间良好预测。这一发现引出一种可能性,即感觉系统在本质上能够将输入转化为共享的、类似嵌入的表征空间的能力。然而,如何在人类行为中呈现此类空间仍不清晰。为此,我们让63名受试者分别对100个自然场景图像和100个对应的句子标题进行相似性判断。我们发现,视觉和语言相似性判断不仅在行为层面收敛,而且还能预测由观看自然场景图像所激发的fMRI脑响应的极其相似的网络结构。此外,训练将图像映射到LLM嵌入的计算模型在解释行为相似性结构方面优于类别训练模型和AlexNet控制模型。这一发现表明,人类视觉和语言相似性判断基于一种共享的、跨模态的表征结构,这种结构反映了视觉系统对经验的编码方式。感官与人工系统之间的收敛暗示了概念表征形成的共同能力——并非作为第一阶次模态特定输入的任意产物,而是反映外部世界稳定、关系性质的结构化表征。
引用
@article{arxiv.2507.21871,
title = {Representations in vision and language converge in a shared, multidimensional space of perceived similarities},
author = {Katerina Marie Simkova and Adrien Doerig and Clayton Hickey and Ian Charest},
journal= {arXiv preprint arXiv:2507.21871},
year = {2025}
}
备注
51 pages, 15 figures