中文

CrossMed:医学影像中基于成分泛化的多模态跨任务基准

计算机视觉与模式识别 2025-11-17 v1 人工智能

摘要

最近的多模态大语言模型进展使能够统一处理视觉和文本输入,为通用医学AI提供了前景。然而,这些模型在面对未见组合的影像模态、解剖学和任务类型时的成分泛化能力尚未得到充分探讨。我们引入CrossMed,一个旨在评估医学多模态LLM成分泛化(CG)的基准,使用结构化的模态-解剖-任务(MAT)模式。CrossMed将四个公开数据集(CheXpert(X光分类)、SIIM-ACR(X光分割)、BraTS 2020(MRI分类和分割)和MosMedData(CT分类))重新格式化为统一的视觉问答(VQA)格式,生成20,200个多选QA实例。我们在与相关MAT分割和不相关MAT分割以及零重叠设置下,对两个开源多模态LLM(LLaVA-Vicuna-7B和Qwen2-VL-7B)进行评估。在相关分割上,模型实现了83.2%的分类准确率和0.75的分割cIoU;而在不相关和零重叠条件下,性能显著下降,表明该基准具有较高难度。我们还展示了跨任务迁移,即使仅使用分类数据训练,分割性能也能提升7个百分点cIoU。传统模型(ResNet-50和U-Net)显示出有限的提升,确认了MAT框架的广泛实用性,而多模态LLM在成分泛化方面独特地表现出色。CrossMed为评估医学视觉语言模型的零样本、跨任务和模态无关化提供了严格的测试环境。

关键词

引用

@article{arxiv.2511.11034,
  title  = {CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging},
  author = {Pooja Singh and Siddhant Ujjain and Tapan Kumar Gandhi and Sandeep Kumar},
  journal= {arXiv preprint arXiv:2511.11034},
  year   = {2025}
}