大型视觉语言模型的表示是否与人类视觉相符?探讨 LVLM 表示与 EEG 信号之间的对应性
人机交互
2026-03-10 v1
摘要
大型视觉语言模型 (LVLMs) 表现出强大的视觉理解和推理能力。然而,其内部表示是否反映人类视觉认知仍未得到充分探索。本文通过量化使用图像诱导的脑电信号 (EEG) 的 LVLM-大脑对齐情况,分析模型架构、规模和图像类型的影响。具体而言,通过使用岭回归和表征相似性分析,将32个开源LVLMs的视觉表征与相应的EEG响应进行比较。我们观察到结构化的LVLM-大脑对应性:首先,中间层(8-16)在100-300 ms窗口内的EEG活性方面显示出峰值对齐,与层级人类视觉处理一致。其次,多模态架构设计比参数规模贡献更多3.4倍的大脑对齐,具有更强下游视觉性能的模型显示出更高的EEG相似性。第三ly,时空模式进一步与已知的皮层视觉通路一致。这些结果表明LVLMs学习了人类对齐的视觉表征,并建立了神经对齐作为评估和改进LVLMs的生物学依据基准。此外,这些结果可能为开发受神经启发的应用提供启发。
引用
@article{arxiv.2603.08303,
title = {Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals},
author = {Xin Xiao and Yang Lei and Haoyang Zeng and Xiao Sun and Xinyi Jiang and Yu Tian and Hao Wu and Kaiwen Wei and Jiang Zhong},
journal= {arXiv preprint arXiv:2603.08303},
year = {2026}
}