中文

Mind-Omni:基于离散扩散的脑-视觉-语言建模统一多任务框架

人工智能 2026-05-29 v1

摘要

建模外部刺激与内部神经表征之间的相互作用是脑机接口(BCI)的一个关键研究领域。先前工作的一个主要局限是专注于特定单任务模型的主流范式,这限制了灵活性并忽视了任务间的协同效应。为此,我们提出了Mind-Omni,首个通过离散扩分式统一七种不同的编码和解码任务的通用框架。在其核心是一种新的脑部标记化器(Brain Tokenizer),将异构的连续脑信号转换为标准化的离散标记。这使得在共享语义空间中,任意两个或多个模态之间能够进行直接的、基于标记的相互理解和生成。为解锁更高级的推理能力,我们进一步构建了一个专门的脑类问题回答(Brain Question Answering, BQA)指令调优数据集。我们的模型不仅在多任务统一框架中建立了新的状态之最,还为多任务协同效应提供了有力证据。通过展示在性能上与更大规模的专用模型相当甚至更优的表现,我们的工作提供了一种强大的神经建模范式,为神经活动的基础模型铺平了道路。代码已公开available at https://github.com/ReedOnePeck/Mind-Omni。

关键词

引用

@article{arxiv.2605.29591,
  title  = {Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion},
  author = {Yizhuo Lu and Changde Du and Qingyu Shi and Hang Chen and Jie Peng and Liuyun Jiang and Shuangchen Zhao and Huiguang He},
  journal= {arXiv preprint arXiv:2605.29591},
  year   = {2026}
}