中文

基于自然化游戏的视觉语言与动作模型推理与行动表征的大脑对齐

神经元与认知 2026-05-20 v1 人工智能 机器学习

摘要

理解人类和人工智能系统如何通过与环境交互来预测和规划是神经科学与机器学习交叉领域的根本性挑战。大多数大脑编码研究专注于在语言理解或被动视觉处理期间将人工模型与大脑活动对齐,而互动性大脑对齐研究目前主要局限于强化学习 (RL) 代理和基于理论的模型。为此,我们研究了来自两种 foundation-model 家族的代表模型——视觉语言模型 (VLMs) 和大型动作模型 (LAMs)——的大脑对齐,这些模型使用来自参与者进行自然化 Atari 风格视频游戏的 fMRI 记录。具体而言,我们检验了 action-focused 和 reasoning-focused 提示如何塑造模型的内部表征并与 fMRI 大脑活动对齐。首先,我们发现 VLMs 和 LAMs 在 voxel-wise 编码性能上显著优于 RL 基准,即使在特征维度匹配的情况下也如此。其次,prompt-driven 的收益随皮层处理层级而扩展:最大的改进出现在前额-顶叶和运动规划区域,而早期视觉皮层的收益大约只有一半。第三,方差分解揭示了不同于以往的表征组织:VLM 是 prompt 对称的(12.5% 唯一动作 vs. 13.6% 唯一推理),而 LAM 是 prompt 非对称的(27% 唯一动作 vs. -5% 唯一推理),这种非对称性在前额-运动皮层最为强烈。综上,这些结果表明,action 专门的微调会重新组织多模态表征,向与动作相关的神经计算倾斜,即使在 VLM 和 LAM 在 whole-brain 预测准确率统计上等价的情况下也如此。

关键词

引用

@article{arxiv.2605.19352,
  title  = {Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay},
  author = {Subba Reddy Oota and Anant Khandelwal and Khushbu Pahwa and Satya Sai Srinath Namburi and Tanmoy Chakraborty and Bapi S. Raju and Manish Gupta},
  journal= {arXiv preprint arXiv:2605.19352},
  year   = {2026}
}

备注

21 pages, 11 figures