通向对未见主体的视觉大脑解码的泛化
计算机视觉与模式识别
2024-10-22 v2 人工智能
摘要
视觉大脑解码旨在从人类脑活动中解码视觉信息。尽管取得了显著进展,但当前大脑解码研究的一个关键局限在于其无法对未见的主体进行泛化。以往的研究通常侧重于基于个体之间不同脑活动特征对单个个体的脑活动进行解码,而是否可以对未见的主体进行脑解码仍然不明确。本研究旨在回答这一问题。我们首先整合了一个由刺激图像和fMRI响应数组成的图像-fMRI数据集,涉及Human Connectome Project (HCP)中177名受试者的电影观看任务。该数据集允许我们 investigate 随着参与者数量增加的大脑解码性能。随后,我们提出了一种学习范式,采用统一的处理方式处理所有受试者,而非像以往方法那样为个体采用不同的网络头或标记化器,从而能够容纳大量受试者以探索不同受试者之间的泛化能力。进行了一系列实验,得出以下结论:首先,随着训练受试者数量的增加,网络表现出明确的泛化能力。其次,泛化能力适用于流行的网络架构(MLP、CNN和Transformer)。第三,泛化性能受受试者相似度的影响。我们的发现揭示了不同个体之间脑活动的内在相似性。随着更大规模和更全面的数据集的出现,未来有望训练一个大脑解码基础模型。代码和模型可在 https://github.com/Xiangtaokong/TGBD 查看。
引用
@article{arxiv.2410.14445,
title = {Toward Generalizing Visual Brain Decoding to Unseen Subjects},
author = {Xiangtao Kong and Kexin Huang and Ping Li and Lei Zhang},
journal= {arXiv preprint arXiv:2410.14445},
year = {2024}
}