中文

探索多模态神经解码的视觉特征空间

计算机视觉与模式识别 2025-05-22 v1

摘要

脑信号的复杂性推动了利用多模态 AI 将脑模态与视觉和文本数据对齐,以提供可解释描述的研究。然而,大多数现有研究仅限于粗糙的解释,缺乏对对象描述、位置、属性及其关系的关键细节,导致基于此类线索进行视觉解码时 reconstruction 不精确且模糊不清。为此,我们分析了来自预训练视觉组件的不同视觉特征空间选择,并引入一种零样本多模态脑解码方法,通过与这些模型交互来实现多个层次细节的解码。% 为评估模型从脑信号中解码细节能力,我们提出了多粒度脑细节理解基准(MG-BrainDub)。该基准包括两个关键任务:详细描述和显著问题解答,以及突出显示关键视觉元素(如对象、属性和关系)的指标。我们的方法提高了神经解码的精度,并支持更准确的神经解码应用。代码将在 https://github.com/weihaox/VINDEX 提供。

关键词

引用

@article{arxiv.2505.15755,
  title  = {Exploring The Visual Feature Space for Multimodal Neural Decoding},
  author = {Weihao Xia and Cengiz Oztireli},
  journal= {arXiv preprint arXiv:2505.15755},
  year   = {2025}
}

备注

Project: https://weihaox.github.io/VINDEX