中文

文本提示的多样化可解释性如何影响医学视觉-语言零样本任务?

计算机视觉与模式识别 2024-10-11 v2 计算与语言 机器学习 图像与视频处理

摘要

近期医学视觉-语言预训练(MedVLP)的进展,通过利用大规模医学图像-文本对预训练,显著增强了零样本医学视觉任务(如图像分类)的性能。然而,这些任务的性能可能受到描述类别的文本提示可变性的严重影响,这要求 MedVLP 模型对多样化的提示风格具有鲁棒性。然而,这种敏感性仍未得到充分探索。在这项工作中,我们首次系统地评估了三种广泛使用的 MedVLP 方法对 15 种不同疾病的多种提示的敏感性。为此,我们设计了六种独特的提示风格以反映真实的临床场景,并随后按可解释性对其进行了排序。我们的发现表明,所有评估的 MedVLP 模型在不同提示风格下都表现出不稳定的性能,表明缺乏鲁棒性。此外,模型的性能随着提示可解释性的增加而变化,揭示了在理解复杂医学概念方面的困难。这项研究强调了进一步发展 MedVLP 方法以增强其对多样化零样本提示鲁棒性的必要性。

关键词

引用

@article{arxiv.2409.00543,
  title  = {How Does Diverse Interpretability of Textual Prompts Impact Medical Vision-Language Zero-Shot Tasks?},
  author = {Sicheng Wang and Che Liu and Rossella Arcucci},
  journal= {arXiv preprint arXiv:2409.00543},
  year   = {2024}
}

备注

Accepted by NeurIPS'24 Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond Workshop