语言调制视觉感知:来自神经网络与脑损伤模型的证据
神经元与认知
2026-03-19 v2
摘要
比较深度神经网络(DNNs)与人类大脑之间的信息结构已成为探索其相似性与差异性的关键方法。近期研究表明,视觉语言DNN模型(如CLIP)与人类视网膜皮层颞上回(VOTC)活动的对齐程度更高,优于早期视觉模型,支持了语言调制人类视觉感知的观念。然而,由于DNNs的“黑箱”本质,解释此类比较结果存在局限。为此,我们将模型-大脑适配度分析与人脑损伤数据相结合,考察干扰视觉系统与语言系统之间通信通道所对视觉语言DNN解释VOTC活动的影响。基于四个多样化数据集,CLIP始终捕获VOTC神经表征的独特方差,相对于标签监督(ResNet)和无监督(MoCo)模型而言。这种优势在群体层面倾向于左侧,与人类语言网络一致。对33名中风患者的分析显示,VOTC与左侧角回语言区之间白质完整性降低,与CLIP-大脑对应性下降以及MoCo-大脑对应性上升相关,表明语言处理对VOTC活动具有动态影响。这些发现支持了语言调制在人类视觉神经认知模型中的整合,强化了视觉语言DNN模型的概念。模型-大脑相似性对特定脑损伤的敏感性表明,利用人脑操作开发类脑计算机模型具有前景。
引用
@article{arxiv.2501.13628,
title = {Language modulates vision: Evidence from neural networks and human brain-lesion models},
author = {Haoyang Chen and Bo Liu and Shuyue Wang and Xiaosha Wang and Wenjuan Han and Yixin Zhu and Xiaochun Wang and Yanchao Bi},
journal= {arXiv preprint arXiv:2501.13628},
year = {2026}
}