MindSemantix:解读脑视觉经验的脑-语言模型
计算机视觉与模式识别
2024-05-30 v1
摘要
通过 fMRI 捕获的大脑活动解读人类视觉经验,是神经科学领域的迷人且前沿的挑战。相较于仅预测观看的图像本身,将脑活动解码为有意义的文字描述提供了更高层次的解释与总结,这在实际应用中更具灵活性。本文引入 MindSemantix,一种新型多模态框架,使大语言模型 (LLM) 能够理解脑活动中诱发的语义内容。MindSemantix 通过构建 LLM 与脑活动分析的融合,塑造一种理想的脑-文字描述范式,形成无缝、端到端的脑-语言模型。为有效捕获脑反应中的语义信息,我们提出 Brain-Text Transformer,核心架构为 Brain Q-Former,将预训练的脑编码器与冻结的 LLM 集成,以实现脑-视觉-语言的多模态对齐,建立稳健的脑-语言对应关系。为增强神经表征的通用性,我们在大规模跨受试者 fMRI 数据集上采用自监督学习技术对脑编码器进行预训练。MindSemantix 在下游脑解码任务中提供更好的可行性;其通过与 Stable Diffusion 等先进生成模型集成,实现对脑视觉感知的深入理解。该方法生成的高质量文字描述深植于从脑活动中提取的视觉与语义信息之中。我们在现有工作基础上实现了显著的量化提升。我们的代码将在发布。
引用
@article{arxiv.2405.18812,
title = {MindSemantix: Deciphering Brain Visual Experiences with a Brain-Language Model},
author = {Ziqi Ren and Jie Li and Xuetong Xue and Xin Li and Fan Yang and Zhicheng Jiao and Xinbo Gao},
journal= {arXiv preprint arXiv:2405.18812},
year = {2024}
}
备注
13 pages, 6 figures