中文

结合视觉与语言模型捕捉人脑中视觉-语义表征的时间演变

神经元与认知 2025-06-25 v1

摘要

人类视觉系统为我们提供了丰富且有意义的感知,使视网膜信号转化为视觉-语义表征。本研究针对这些表征的模型,利用了两种当前主导方法:视觉深度神经网络(DNN)和大语言模型(LLM)。使用大规模人类脑电信号(EEG)数据记录的物体图像观看数据,我们构建了编码模型,用视觉 DNN、LLM 以及它们的融合表示来预测EEG 响应。我们证明,融合编码模型在预测视觉刺激的神经响应方面,优于基于单独视觉 DNN 或 LLM 的编码模型,以及以往的建模方法。在解释EEG 响应中与刺激相关信号方面,视觉 DNN 与 LLM 相互补充。视觉 DNN 独特地捕捉了更早及宽带的EEG信号,而 LLM 独特地捕捉了更晚及低频信号,以及详细的视觉-语义刺激信息。就人脑中视觉-语义处理的时间演变而言,这提供了更准确的模型。

关键词

引用

@article{arxiv.2506.19497,
  title  = {The time course of visuo-semantic representations in the human brain is captured by combining vision and language models},
  author = {Boyan Rong and Alessandro Thomas Gifford and Emrah Düzel and Radoslaw Martin Cichy},
  journal= {arXiv preprint arXiv:2506.19497},
  year   = {2025}
}