SURE-VQA:医学 VQA 任务中鲁棒性评估的系统性理解
计算机视觉与模式识别
2025-07-04 v3 机器学习
摘要
视觉语言模型 (VLM) 在医学任务中具有巨大潜力,例如视觉问答 (VQA),它们可作为患者和临床医生的交互式助手。然而,这些模型在未见数据上的分布迁移鲁棒性仍是安全部署的关键关切。评估此类鲁棒性需要能够系统性洞察模型行为的受控实验 setup。然而,我们展示了当前的 setup未能提供足够深入的评估。为弥补这一差距,我们引入了名为 SURE-VQA 的新型框架,围绕三项关键要求展开,以克服当前困境并系统性分析 VLM 的鲁棒性:1) 由于合成分布迁移的鲁棒性不一定转化为现实世界的分布迁移,因此应在源自 VQA 数据本身的现实世界分布迁移上进行测量;2) 传统的 token 匹配指标往往难以捕捉底层语义,亟需采用大语言模型 (LLM) 进行更精准的语义评估;3) 模型性能因缺乏理想基线而缺乏可解释性,因此应报告有意义的基线,以便评估 VLM 的多模态影响。为展示此框架的相关性,我们在三个医学数据集上进行了研究,考察了四类分布迁移下各种精细调优 (Fine-Tuning, FT) 方法的鲁棒性。我们的研究揭示了关键见解:1) 没有任何 FT 方法在鲁棒性上一致优于其他方法;2) 鲁棒性在不同 FT 方法之间保持更稳定,而在不同分布迁移之间则不稳定。此外,我们发现不使用图像数据的简单理想基线竟能出奇制胜,并确认在分布内数据上,LoRA 是表现最佳的 FT 方法。代码已提供至 https://github.com/IML-DKFZ/sure-vqa。
引用
@article{arxiv.2411.19688,
title = {SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks},
author = {Kim-Celine Kahl and Selen Erkan and Jeremias Traub and Carsten T. Lüth and Klaus Maier-Hein and Lena Maier-Hein and Paul F. Jaeger},
journal= {arXiv preprint arXiv:2411.19688},
year = {2025}
}
备注
TMLR 07/2025