MedFM-Robust:医学基础模型鲁棒性基准测试
计算机视觉与模式识别
2026-05-26 v3
摘要
医学基础模型已在临床应用中取得显著性能,但其在现实世界扰动下的鲁棒性仍未得到充分探索。我们提出了一个包含40种扰动类型(12种基础扰动,28种医学专用扰动)的鲁棒性基准测试,覆盖八种影像模态,评估了五个视觉语言模型(LLaVA-Med、MedGemma、MedGemma-1.5、Gemini-2.5-flash和GPT-4o-mini)在VQA、视觉定位和描述生成任务中的表现,同时对两个分割模型(MedSAM、SAM-Med2D)采用五种微调策略进行测试。我们的发现表明:(1)微调策略对鲁棒性影响显著,LoRA几乎产生双倍的性能下降,而SAM-Med2D的Adapter在效率与鲁棒性之间取得了良好平衡。(2)医学专用扰动对分割任务的损伤占比最高,15种顶级损坏中有9种为领域特定。(3)LoRA微调的视觉定位性能下降超过40分,而零样本描述生成保持稳定(<7%下降)。零样本VQA显示出模型依赖性鲁棒性——医学模型下降幅度<20%,而Gemini-2.5-flash下降54%。通用型VLM在VQA准确率更高,但在定位任务中表现不足;在医学VLM中,MedGemma展现出最佳的整体稳定性。这些结果提供了部署指南,强调了医学AI领域特定鲁棒性评估的必要性。我们的代码已公开:https://abnerai.github.io/MedFM-Robust。
引用
@article{arxiv.2605.19027,
title = {MedFM-Robust: Benchmarking Robustness of Medical Foundation Models},
author = {Xiangxiang Cui and Tianjin Huang and Yifang Wang and Lijie Hu and Lu Yin},
journal= {arXiv preprint arXiv:2605.19027},
year = {2026}
}
备注
MICCAI2026