中文

通过脑-视觉-语言特征的多模态学习解码视觉神经表征

计算机视觉与模式识别 2023-03-31 v2 人工智能 多媒体 神经与进化计算

摘要

解码人类视觉神经表征是一项具有挑战性的任务,在揭示视觉处理机制和发展类脑智能机器方面具有重要的科学意义。大多数现有方法难以泛化到没有对应神经数据用于训练的新类别。两个主要原因是:1) 对神经数据底层多模态语义知识的利用不足;2) 配对的(刺激-响应)训练数据量少。为克服这些局限,本文提出一种称为BraVL的通用神经解码方法,该方法利用脑-视觉-语言特征的多模态学习。我们专注于通过多模态深度生成模型建模脑、视觉和语言特征之间的关系。具体而言,我们利用专家乘积混合公式推断一个潜变量编码,从而实现所有三种模态的连贯联合生成。为了在有限脑活动数据情况下学习更一致的联合表征并提高数据效率,我们利用了模态内和模态间的互信息最大化正则项。特别是,我们的BraVL模型可在多种半监督场景下训练,以融入从额外类别获得的视觉和文本特征。最后,我们构建了三个三模态匹配数据集,大量实验得出了一些有趣的结论和认知见解:1) 从人脑活动中解码新视觉类别在实际中具有良好精度是可行的;2) 使用视觉与语言特征组合的的解码模型表现远优于单独使用任一特征的模型;3) 视觉感知可能伴随语言影响来表示视觉刺激语义。代码与数据:https://github.com/ChangdeDu/BraVL。

关键词

引用

@article{arxiv.2210.06756,
  title  = {Decoding Visual Neural Representations by Multimodal Learning of Brain-Visual-Linguistic Features},
  author = {Changde Du and Kaicheng Fu and Jinpeng Li and Huiguang He},
  journal= {arXiv preprint arXiv:2210.06756},
  year   = {2023}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)