中文

MindGPT:基于无创脑记录解读你所见

计算机视觉与模式识别 2023-09-28 v1 人工智能

摘要

利用无创脑记录解码所见视觉内容具有重要的科学和实际价值。已有研究致力于从脑信号中恢复所见图像。然而,大多数现有方法由于图像质量不足或语义不匹配,无法忠实反映视觉内容。与重建像素级视觉图像相比,言语是解释视觉信息更高效且有效的方式。在此我们引入一种无创神经解码器,称为MindGPT,其从fMRI信号中将感知到的视觉刺激解读为自然语言。具体而言,我们的模型构建于具有交叉注意力机制的视觉引导神经编码器之上,通过协同使用大语言模型GPT,使我们能够以端到端方式将潜在神经表征引导至期望的语言语义方向。通过这样做,我们发现MindGPT的神经表征是可解释的,可用于评估视觉属性对语言语义的贡献。我们的实验表明,生成的词序列真实表示了所见刺激中传达的视觉信息(含关键细节)。结果还表明,就语言解码任务而言,高级视觉皮层(HVC)比低级视觉皮层(LVC)更具语义信息性,且仅使用HVC即可恢复大部分语义信息。MindGPT模型的代码将在 https://github.com/JxuanC/MindGPT 公开。

关键词

引用

@article{arxiv.2309.15729,
  title  = {MindGPT: Interpreting What You See with Non-invasive Brain Recordings},
  author = {Jiaxuan Chen and Yu Qi and Yueming Wang and Gang Pan},
  journal= {arXiv preprint arXiv:2309.15729},
  year   = {2023}
}

备注

13 pages, 6 figures, submitted to anonymous conference