BrainChat: 利用视觉语言预训练模型从fMRI中解码语义信息
计算机视觉与模式识别
2024-06-13 v1 人工智能
计算与语言
摘要
语义信息对人类交互至关重要,从脑活动中解码它能够实现非侵入性的临床辅助和替代沟通。虽然图像重建领域取得了显著进展,但鲜有研究聚焦于语言方面。为填补这一空白,本文利用解码器式视觉语言预训练模型CoCa的强大能力,提出BrainChat,一个简单而有效的生成框架,旨在快速完成从脑活动中解码语义信息的任务,包括fMRI问答和fMRI描述生成。BrainChat采用掩码脑建模的自监督方法对稀疏fMRI数据进行编码,获得更紧凑的潜在空间嵌入表示。随后,BrainChat通过对比损失在模态之间搭建桥梁,实现fMRI、图像和文本嵌入表示的对齐。此外,fMRI嵌入通过交叉注意力层映射到生成Brain Decoder,通过最小化描述损失,以回归方式引导生成关于fMRI的文本内容。经验上,BrainChat在fMRI描述生成任务上超越了现有SOTA方法,并且首次实现了fMRI问答。此外,BrainChat高度灵活,可在没有图像数据的情况下实现高性能,这使其更适用于数据有限的实际场景。
引用
@article{arxiv.2406.07584,
title = {BrainChat: Decoding Semantic Information from fMRI using Vision-language Pretrained Models},
author = {Wanaiu Huang},
journal= {arXiv preprint arXiv:2406.07584},
year = {2024}
}