基于多模态Transformer的脑编码模型可跨语言与视觉迁移
计算与语言
2023-05-23 v1 计算机视觉与模式识别
摘要
编码模型已被用于评估人脑如何表征语言与视觉中的概念。尽管语言与视觉依赖相似的概念表征,当前的编码模型通常分别在孤立的每种模态脑响应上训练与测试。多模态预训练的最新进展产生了可从语言与视觉中提取对齐概念表征的Transformer。本工作中,我们利用多模态Transformer的表征来训练可跨故事与电影fMRI响应迁移的编码模型。我们发现,在一种模态脑响应上训练的编码模型能成功预测另一种模态的脑响应,尤其在表征概念含义的皮层区域。对这些编码模型的进一步分析揭示了语言与视觉中概念表征背后的共享语义维度。比较使用多模态与单模态Transformer表征训练的编码模型,我们发现多模态Transformer学到了语言与视觉中更对齐的概念表征。我们的结果展示了多模态Transformer如何为大脑的多模态处理能力提供见解。
引用
@article{arxiv.2305.12248,
title = {Brain encoding models based on multimodal transformers can transfer across language and vision},
author = {Jerry Tang and Meng Du and Vy A. Vo and Vasudev Lal and Alexander G. Huth},
journal= {arXiv preprint arXiv:2305.12248},
year = {2023}
}