fMRI-LM:面向通用 fMRI 理解的语言对齐基础模型
计算与语言
2026-05-15 v4 人工智能
摘要
最近的多模态大语言模型(LLM)进展使跨图像、音频和视频的统一推理成为可能,但将此类能力扩展到脑成像领域仍鲜有探索。弥合这一差距对于将神经活动与语义认知联系起来以及开发跨模态脑表征至关重要。为此,我们提出 fMRI-LM,一个通过三阶段框架将功能性 MRI(fMRI)与语言相连的基础模型。在阶段 1,我们学习一个神经分词器,将 fMRI 映射到与语言一致的离散标记空间。在阶段 2,适配的预训练 LLM 被用于联合建模 fMRI 标记和文本,将脑活动视为可以 temporally 预测和语言描述的序列。为克服缺乏自然 fMRI 文本对的限制,我们构建了一个大型描述性语料库,将多样化的成像特征翻译为结构化文本描述,捕捉 fMRI 信号的低层组织。在阶段 3,我们进行多任务、多范式指令调优,赋予 fMRI-LM 高水平语义理解能力,支持多样化的下游应用。在各种基准测试中,fMRI-LM 实现了强大的零样本和少样本性能,并通过参数高效调优(LoRA)实现高效适配,为通往语言对齐、通用 fMRI 结构和语义理解之路奠定了可扩展的基础。
引用
@article{arxiv.2511.21760,
title = {fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding},
author = {Yuxiang Wei and Yanteng Zhang and Xi Xiao and Chengxuan Qian and Tianyang Wang and Vince D. Calhoun},
journal= {arXiv preprint arXiv:2511.21760},
year = {2026}
}
备注
Code are available: https://github.com/yuxiangwei0808/fMRI-LM