中文

医学视觉语言模型鲁棒性探讨:其通用性是否真实?

计算机视觉与模式识别 2025-05-26 v2

摘要

医学视觉语言模型 (MVLMs) 在医学图像分析中取得优异的泛化性能,但在噪声、受损条件下的表现仍鲜有测试。临床影像本质上易受获取伪影和噪声影响;然而,现有评估主要在干净数据集上进行,忽略了鲁棒性——即模型在真实世界失真条件下的性能。为填补这一空白,本文首先引入 MediMeta-C,系统性地在多个医学影像数据集上应用多种扰动,构成医学 MVLMs 鲁棒性评估框架。结合 MedMNIST-C,形成完整的鲁棒性评估体系。进一步提出 RobustMedCLIP,一种针对预训练 MVLMs 的视觉编码器适配方案,融合 few-shot 调优以提升对扰动的鲁棒性。通过大量实验,对 5 个主要 MVLMs 在 5 种医学影像模态上进行基准测试,结果显示现有模型在扰动下严重退化,难以处理域-模态权衡问题。我们的发现凸显了多样化训练和鲁棒适配策略的必要性,表明高效的低秩适配结合 few-shot 调优,可在保持跨模态泛化性的同时提升鲁棒性。

关键词

引用

@article{arxiv.2505.15425,
  title  = {On the Robustness of Medical Vision-Language Models: Are they Truly Generalizable?},
  author = {Raza Imam and Rufael Marew and Mohammad Yaqub},
  journal= {arXiv preprint arXiv:2505.15425},
  year   = {2025}
}

备注

Dataset and Code is available at https://github.com/BioMedIA-MBZUAI/RobustMedCLIP Accepted at: Medical Image Understanding and Analysis (MIUA) 2025