中文

MedMoE:用于医学视觉语言理解的模态专用混合专家

计算机视觉与模式识别 2025-06-12 v2

摘要

不同的医学成像模态以不同的空间分辨率捕获诊断信息,从粗糙的全局模式到细微的局部结构。然而,大多数现有的医学领域视觉语言框架应用统一的策略进行局部特征提取,忽略了模态特定的需求。本文提出了 MedMoE(Modality-Expert),一个模块化且可扩展的视觉语言处理框架,能够根据诊断上下文动态调整视觉表征。MedMoE 集成了一个基于报告类型的混合专家(MoE)模块,该模块将多尺度图像特征路由到专门用于捕获模态特定视觉语义的专家分支。这些专家 operate on 来自 Swin Transformer 骨干网络的特征金字塔上,实现对临床相关区域的空间自适应注意力。该框架产生与文本描述对齐的局部视觉表征,而无需在推理时使用模态特定的监督。实验结果表明,MedMoE 在多样化的医学基准测试上提高了跨模态的对齐和检索性能,凸显了在临床视觉语言系统中模态专用视觉表征的价值。

关键词

引用

@article{arxiv.2506.08356,
  title  = {MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding},
  author = {Shivang Chopra and Gabriela Sanchez-Rodriguez and Lingchao Mao and Andrew J Feola and Jing Li and Zsolt Kira},
  journal= {arXiv preprint arXiv:2506.08356},
  year   = {2025}
}