中文

Mammo-CLIP:一种提升乳腺X线摄影数据效率与鲁棒性的视觉语言基础模型

图像与视频处理 2024-05-24 v2 计算机视觉与模式识别

摘要

在乳腺癌检测中,计算机辅助诊断(CAD)缺乏大规模且多样化的训练数据一直是阻碍其系统应用的问题之一。最近,通过视觉语言模型(VLM,如CLIP)在大规模图像-文本数据集上进行预训练,部分解决了计算机视觉(CV)中的鲁棒性和数据效率问题。本文提出Mammo-CLIP,这是首个在大量筛查性乳腺X线摄影-报告对上进行预训练的VLM,解决了数据集多样性和规模方面的挑战。我们在两个公开数据集上的实验表明,该模型在对乳腺癌检测至关重要的各种乳腺X线摄影属性进行分类和定位方面表现出色,展现了与CV中CLIP类似的数据效率和鲁棒性。我们还提出了Mammo-FActOR,一种新颖的特征归因方法,用于在乳腺X线摄影报告内提供句子级粒度的表示空间解释。代码公开:\url{https://github.com/batmanlab/Mammo-CLIP}。

关键词

引用

@article{arxiv.2405.12255,
  title  = {Mammo-CLIP: A Vision Language Foundation Model to Enhance Data Efficiency and Robustness in Mammography},
  author = {Shantanu Ghosh and Clare B. Poynton and Shyam Visweswaran and Kayhan Batmanghelich},
  journal= {arXiv preprint arXiv:2405.12255},
  year   = {2024}
}

备注

MICCAI 2024, early accept, top 11%