中文

基于分层混合专家的多模态 LLM 用于 3D 脑部 MRI 的 VQA

计算机视觉与模式识别 2026-02-16 v3 计算与语言

摘要

多参数 3D 脑部 MRI (mpMRI) 是神经放射学的核心,但为神经外科手术规划生成肿瘤位置、外观、大小及关键结构受累情况仍具挑战性。我们引入了 mpLLM,一种用于 mpMRI 上视觉问答 (VQA) 的多模态 LLM,它能产生临床可解释的肿瘤描述符(例如体积、形态、范围和粗略定位),作为转诊神经外科医生临床专业知识的辅助。mpLLM 使用提示条件化的分层混合专家 (MoE),通过在模态级和 token 级投影专家上进行路由来融合多个 3D 序列,从而无需大规模图像-报告预训练即可实现数据高效的端到端训练。为解决配对图像-文本监督有限的问题,我们提出了一种合成 VQA 协议,该协议从专家分割标注中推导出具有临床依据的问答,并与放射科医生合作进行了验证。在多个 mpMRI 数据集上,mpLLM 平均超过强医学 VLM 基线 +5.5 分(相对提升 +9.1%),并将放射科医生评定的临床可接受度提高了 +15.9 分(相对提升 +46.6%)。我们的研究包含三个主要贡献:(1) 首个用于 3D 脑部 mpMRI 的 VQA 数据集,(2) 用于对相互关联的 3D 序列进行联合推理的分层 MoE 架构,以及 (3) 专家支持的关于临床实用性的证据。源代码可在 https://github.com/arvindmvepa/mpllm 获取,我们将在发表后发布数据集。

关键词

引用

@article{arxiv.2509.25889,
  title  = {Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI},
  author = {Arvind Murari Vepa and Yannan Yu and Jingru Gan and Anthony Cuturrufo and Michael F. Romano and Weikai Li and Fabien Scalzo and Wei Wang and Yizhou Sun},
  journal= {arXiv preprint arXiv:2509.25889},
  year   = {2026}
}

备注

17 pages, 3 figures