通过fMRI基准神经编码揭示视觉语言模型中脑类层次模式
计算机视觉与模式识别
2025-10-21 v1
摘要
虽然脑启发式人工智能(AI)已显示出有前景的成果,但当前对人工神经网络(ANNs)与人脑处理之间平行性的理解仍有限:(1)单模态ANN研究未能捕捉到脑内固有的多模态处理能力; (2)多模态ANN研究主要聚焦于高层模型输出,忽视了单个神经元的关键作用。为此,我们提出一种新型的神经元水平分析框架,通过人脑活动的视角来探究视觉语言模型(VLMs)中的多模态信息处理机制。我们的研究方法独特地将细粒度的人工神经元(AN)分析与fMRI基准神经元编码相结合,用于检验两种 architecturally 不同的VLMs: CLIP和METER。我们的分析揭示了四项关键发现:(1)ANs成功预测生物神经元(BNs)在多个功能网络(包括语言、视觉、注意力和默认模式网络)中的活动,表明存在共享的表征机制; (2)ANs和BNs均通过重叠的神经表征表现出功能冗余,类似于大脑容错和协作信息处理机制; (3)ANs表现出与BNs相同的极性模式,激活程度相反的BNs在VLM不同层次上呈现镜像化的激活趋势,反映了神经信息处理的复杂性和双向性; (4)CLIP和METER的 architecture 驱动不同的BNs:CLIP的独立分支显示特定模态的专化,而METER的跨模态设计产生统一的跨模态激活,凸显了architecture对ANs脑类特性的影响。这些结果为VLMs在神经元水平上实现脑类层次处理提供了令人信服的证据。
引用
@article{arxiv.2510.16870,
title = {Uncovering Brain-Like Hierarchical Patterns in Vision-Language Models through fMRI-Based Neural Encoding},
author = {Yudan Ren and Xinlong Wang and Kexin Wang and Tian Xia and Zihan Ma and Zhaowei Li and Xiangrong Bi and Xiao Li and Xiaowei He},
journal= {arXiv preprint arXiv:2510.16870},
year = {2025}
}
备注
14 pages, 7 figures