运用多模态网络揭示大脑中视觉语言整合
机器学习
2024-06-21 v1 人工智能
神经与进化计算
神经元与认知
摘要
我们利用(多)模态深度神经网络(DNNs)来探寻大脑中多模态整合部位,通过预测观看电影时人类受试者的立体脑电图(SEEG)记录。我们将多模态整合的站点定义为:多模态视觉语言模型在预测SEEG记录方面优于单模态语言、单模态视觉或线性整合的语言-视觉模型的区域。我们的目标DNN模型涵盖不同的架构(例如卷积网络和变换器)和多模态训练技术(例如交叉注意力和对比学习)。作为一个关键的Enabling步骤,我们首先展示,训练好的视觉和语言模型在预测SEEG信号方面系统性地优于其随机初始化的对手。随后,我们比较单模态和多模态模型。由于我们的目标DNN模型通常具有不同的架构、参数数量和训练集(可能掩盖了归因于整合的差异),我们对两个模型(SLIP和SimCLR)进行受控比较,这两个模型除输入模态外保留了所有其他属性。通过这种方法,我们识别出大量神经站点(平均141个占总计1090个站点的12.94%)和脑区,其中似乎发生了多模态整合。此外,我们发现,在我们评估的多模态训练技术变体中,CLIP式训练最适合预测这些站点的神经活动。
引用
@article{arxiv.2406.14481,
title = {Revealing Vision-Language Integration in the Brain with Multimodal Networks},
author = {Vighnesh Subramaniam and Colin Conwell and Christopher Wang and Gabriel Kreiman and Boris Katz and Ignacio Cases and Andrei Barbu},
journal= {arXiv preprint arXiv:2406.14481},
year = {2024}
}
备注
ICML 2024; 23 pages, 11 figures