中文

解码多模态心智:通过多模态对齐和自适应路由实现通用的脑-文本翻译

计算与语言 2025-08-12 v2

摘要

从人类大脑解码语言仍是脑机接口(BCI)的巨大挑战。当前方法通常依赖单模态脑表征,忽视了大脑固有的多模态处理。灵感来自大脑的关联机制,其中观看图像会唤起相关的声音和语言表征。我们提出了一个统一框架,利用多模态大型语言模型(MLLMs)将脑信号与包含文本、图像和音频的共享语义空间对齐。路由模块根据每个刺激的特征动态选择和融合特定模态的脑特征。实验在包括文本、视觉和听觉刺激的各种fMRI数据集上进行,显示出现代性能,实现了最常用基准测试的8.48%的改进。我们进一步将框架扩展到EEG和MEG数据,展示了在不同时间和空间分辨率下的灵活性和鲁棒性。据我们了解,这是首个能够在多样化脑信号和刺激类型中稳健解码多模态脑活动的统一BCI架构,为实际应用提供了灵活解决方案。

关键词

引用

@article{arxiv.2505.10356,
  title  = {Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing},
  author = {Chunyu Ye and Yunhao Zhang and Jingyuan Sun and Chong Li and Chengqing Zong and Shaonan Wang},
  journal= {arXiv preprint arXiv:2505.10356},
  year   = {2025}
}