中文

BrainChat: 利用视觉语言预训练模型从fMRI中解码语义信息

计算机视觉与模式识别 2024-06-13 v1 人工智能 计算与语言

摘要

语义信息对人类交互至关重要,从脑活动中解码它能够实现非侵入性的临床辅助和替代沟通。虽然图像重建领域取得了显著进展,但鲜有研究聚焦于语言方面。为填补这一空白,本文利用解码器式视觉语言预训练模型CoCa的强大能力,提出BrainChat,一个简单而有效的生成框架,旨在快速完成从脑活动中解码语义信息的任务,包括fMRI问答和fMRI描述生成。BrainChat采用掩码脑建模的自监督方法对稀疏fMRI数据进行编码,获得更紧凑的潜在空间嵌入表示。随后,BrainChat通过对比损失在模态之间搭建桥梁,实现fMRI、图像和文本嵌入表示的对齐。此外,fMRI嵌入通过交叉注意力层映射到生成Brain Decoder,通过最小化描述损失,以回归方式引导生成关于fMRI的文本内容。经验上,BrainChat在fMRI描述生成任务上超越了现有SOTA方法,并且首次实现了fMRI问答。此外,BrainChat高度灵活,可在没有图像数据的情况下实现高性能,这使其更适用于数据有限的实际场景。

关键词

引用

@article{arxiv.2406.07584,
  title  = {BrainChat: Decoding Semantic Information from fMRI using Vision-language Pretrained Models},
  author = {Wanaiu Huang},
  journal= {arXiv preprint arXiv:2406.07584},
  year   = {2024}
}