中文

见你所见:从脑活动自监督跨模态检索视觉刺激

多媒体 2022-08-19 v4 计算机视觉与模式识别 人机交互

摘要

近期研究展示了使用两阶段监督框架从 EEG 生成描绘人对视觉刺激感知的图像,即 EEG-视觉重建。然而,它们无法复现确切的视觉刺激,因为决定合成图像内容的是人为指定的图像标注而非图像数据。此外,合成图像常受噪声 EEG 编码和生成模型不稳定训练的影响,难以辨识。相反,我们提出单阶段 EEG-视觉检索范式,其中两种模态的数据(而非标注)被关联,从而能为一段 EEG 片段恢复确切的视觉刺激。我们通过优化对比自监督目标最大化 EEG 编码与关联视觉刺激之间的互信息,带来两个额外好处。其一,它使 EEG 编码能处理训练期间未见的视觉类别,因为学习不指向类别标注。另外,模型不再需要生成视觉刺激的每一个细节,而是聚焦于跨模态对齐并在实例级检索图像,确保可区分的模型输出。实证研究在最大的单被试 EEG 数据集上进行,该数据集测量由图像刺激引发的大脑活动。我们证明所提方法完成了现有方法无法实现的实例级 EEG-视觉检索任务。我们还考察了一系列 EEG 与视觉编码器结构的影响。此外,对于研究较多的语义级 EEG-视觉分类任务,尽管未使用类别标注,所提方法仍优于最先进的监督 EEG-视觉重建方法,尤其在开放类别识别能力上。

关键词

引用

@article{arxiv.2208.03666,
  title  = {See What You See: Self-supervised Cross-modal Retrieval of Visual Stimuli from Brain Activity},
  author = {Zesheng Ye and Lina Yao and Yu Zhang and Sylvia Gustin},
  journal= {arXiv preprint arXiv:2208.03666},
  year   = {2022}
}