中文

基于预训练视觉语言模型的医学图像理解:一项综合研究

计算机视觉与模式识别 2023-02-08 v2

摘要

大规模预训练的视觉语言模型(VLM)在自然图像上已展现出显著的领域迁移能力。然而,这种能力是否也能应用于医学图像领域仍属未知。本文深入研究了预训练VLM向医学领域的知识可迁移性,表明精心设计的医学提示词是激发预训练VLM知识的关键。我们证明,通过使用跨领域共享的、具有表现力的属性进行提示,VLM能够跨领域携带知识并改善其泛化能力。这一机制使VLM能够以更少甚至无需图像样本来识别新物体。此外,为避免繁琐的手动设计过程,我们开发了三种自动生成医学提示词的方法,可将专家级医学知识与图像特定信息注入提示词以实现细粒度定位。我们在跨越多种模态的十三个不同医学数据集上进行了大量实验,结果表明,与默认提示词相比,我们精心设计的提示词大幅提升了零样本性能,且我们微调后的模型显著优于有监督模型。

关键词

引用

@article{arxiv.2209.15517,
  title  = {Medical Image Understanding with Pretrained Vision Language Models: A Comprehensive Study},
  author = {Ziyuan Qin and Huahui Yi and Qicheng Lao and Kang Li},
  journal= {arXiv preprint arXiv:2209.15517},
  year   = {2023}
}

备注

Accepted to ICLR2023