中文

基于跨主体软ROI融合的统一多模态大脑解码

机器学习 2026-04-21 v3 计算机视觉与模式识别 图像与视频处理

摘要

多模态大脑解码旨在从脑活动信号(如fMRI)中重建与视觉刺激一致的语义信息,然后生成可读的自然语言描述。然而,跨主体泛化和可解释性仍是多模态大脑解码面临的关键挑战。我们提出了BrainROI模型,在NSD数据集上的脑-字幕评估中取得领先水平。在跨主体设置下,与最新的SOTA方法和代表性基线方法相比,BLEU-4和CIDEr等指标均显示出明显的改进。首先,为了解决跨主体功能脑拓扑异质性问题,我们设计了新的fMRI编码器。我们使用多图谱软功能分割(软ROI)作为共享空间。我们将MINDLLM中的离散ROI拼接策略扩展为基于体素的门控融合机制(Voxel-gate)。我们还通过全局标签对齐确保一致的ROI映射,这增强了跨主体迁�性。其次,为了克服手动和黑箱式提示方法在稳定性和透明性方面的局限性,我们引入了可解释的提示优化过程。在小样本闭环中,我们使用本地部署的Qwen模型迭代生成和筛选人类可读提示。这一过程改善了提示设计的稳定性并保留了可审计的优化轨迹。最后,我们在推断过程中施加参数化解码约束,以进一步提高生成描述的稳定性和质量。

关键词

引用

@article{arxiv.2512.20249,
  title  = {Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion},
  author = {Xuanyu Hu},
  journal= {arXiv preprint arXiv:2512.20249},
  year   = {2026}
}

备注

15 pages, 2 figures, 4 tables