BrainCLIP:基于 CLIP 桥接脑与视觉-语言表征的通用自然视觉刺激解码
计算机视觉与模式识别
2023-05-16 v3 人工智能
人机交互
摘要
由于配对样本匮乏以及功能磁共振成像(fMRI)信号信噪比低,从 fMRI 数据重建感知的自然图像或解码其语义内容是具有挑战性的任务。本工作中,我们首次提出一种任务无关的基于 fMRI 的脑解码模型 BrainCLIP,其利用 CLIP 的跨模态泛化能力来弥合脑活动、图像与文本之间的模态鸿沟。我们的实验表明,CLIP 可作为通用脑解码任务的中枢,包括零样本视觉类别解码、fMRI-图像/文本匹配以及 fMRI 到图像生成。具体而言,BrainCLIP 旨在训练一个映射网络,通过结合视觉与文本监督将 fMRI 模式变换到良好对齐的 CLIP 嵌入空间。实验显示该组合能提升解码模型在诸如 fMRI-文本匹配和 fMRI-到-图像生成等特定任务上的性能。在零样本视觉类别解码任务上,BrainCLIP 显著优于近期专为该任务提出的多模态方法 BraVL。BrainCLIP 还能以高语义保真度重建视觉刺激,并基于 fMRI 的自然图像重建在高阶语义特征方面确立了新的 SOTA。
引用
@article{arxiv.2302.12971,
title = {BrainCLIP: Bridging Brain and Visual-Linguistic Representation Via CLIP for Generic Natural Visual Stimulus Decoding},
author = {Yulong Liu and Yongqiang Ma and Wei Zhou and Guibo Zhu and Nanning Zheng},
journal= {arXiv preprint arXiv:2302.12971},
year = {2023}
}