Brain-IT-VQA:从脑信号到答案
计算机视觉与模式识别
2026-05-29 v1 人工智能
神经元与认知
摘要
从解码在观看图像时记录的 fMRI 信号以特别回答关于所见图像的问题,是长久以来的挑战。尽管近年来在 fMRI 上的视觉问答 (VQA) 方面取得了显著进展,但性能仍有限。而且,尽管最近的模型能够越来越准确地做出预测,但它们很少被用作理解大脑视觉表征结构的工具。我们提出 Brain-IT-VQA,一个用于从 fMRI 进行视觉问答的框架。基于 Brain Interaction Transformer (Brain-IT),我们的方法从脑活动解码语言 token 并将其与语言模型集成以回答视觉问题。我们的模型显著优于以前的基于 fMRI 的字幕和 VQA 方法。我们进一步引入 NSD-VQA,一个用于从 fMRI 进行视觉问答的新数据集和基准。与现有图像-fMRI VQA 数据集不同,后者通常仅为每个图像提供少数宽泛且控制不严的 question-answer 对,而 NSD-VQA 为每个图像在 20 个受控 question 类别中提供平均 20 个 question-answer 对。这使得尽管 fMRI 测试数据有限,仍能实现更可靠和可解释的评估。总的来说,Brain-IT-VQA 和 NSD-VQA 提供了一个强大的预测框架和研究大脑表征的工具。使用这个基准,我们量化了哪些形式的视觉和语义信息可以可靠地从自然图像的 fMRI 响应中解码。我们进一步分析了不同 question 类型下不同脑区的贡献。
引用
@article{arxiv.2605.29588,
title = {Brain-IT-VQA: From Brain Signals to Answers},
author = {Roman Beliy and Matias Cosarinsky and Oliver Heinimann and Navve Wasserman and Michal Irani},
journal= {arXiv preprint arXiv:2605.29588},
year = {2026}
}