中文

使用前缀语言建模将 fMRI 数据解码为描述文本

计算机视觉与模式识别 2025-01-07 v1 人工智能 计算与语言

摘要

随着大语言模型和潜在扩散模型的进展,脑解码近年来取得了显著成果。基于 NSD 数据集(其刺激图像来自 COCO 数据集)的工作,利用 CLIP 模型的嵌入进行图像重建,并利用 GIT 生成描述文本。然而,鉴于 GIT 模型是在 COCO 数据集上训练的,当前的描述文本生成方法引入了潜在数据污染的挑战。在本工作中,我们提出了一种替代方法,通过从相应的 fMRI 信号预测图像的 DINOv2 模型嵌入,然后将其 [CLS] 标记作为 GPT-2 语言模型的前缀,从而将脑信号解码为图像描述文本,这显著降低了计算需求。此外,我们探索了 fMRI 信号到图像嵌入空间的 3D 卷积神经网络映射,而非常用的线性回归,以更好地考虑体素的位置信息。

关键词

引用

@article{arxiv.2501.02570,
  title  = {Decoding fMRI Data into Captions using Prefix Language Modeling},
  author = {Vyacheslav Shen and Kassymzhomart Kunanbayev and Dae-Shik Kim},
  journal= {arXiv preprint arXiv:2501.02570},
  year   = {2025}
}

备注

4 pages, 2 tables, 1 figure