中文

MAM-CLIP:用于乳腸钼化图谱的视觉-语言预训练与 BI-RADS 分类

计算机视觉与模式识别 2026-05-20 v1 机器学习

摘要

深度学习方法已在从乳腸钼化图像预测 BI-RADS 分数方面显示出前景,但图像解释可能因主观差异而产生一致性问题。鉴于乳腸钼化图的内在复杂性,仅依据图像标签训练分类模型往往性能有限。为此,我们精选了 2313 张乳腸钼化图像及其对应描述,并构建了多模态模型。该模型采用预训练的 PubMedBERT 作为语言组件,基于图像-文本配对进行对比学习训练,使视觉编码器能吸收描述中蕴含的丰富信息,从而提高对乳腸钼化发现的理解。随后在两个数据集上微调视觉编码器进行 BI-RADS 预测,性能优于未进行此类预训练的模型,尤其在标注样本稀缺时效果显著。3 类平均 F1 分数提升范围为 +1%至 +14%:在 4 万张训练样本时提升 +1%,在 1 万张样本时提升 +14%。此外,实验表明,仅用 2000 张乳腸钼化图谱图像-文本配对即可胜于 2000 张带标签样本用于预测标签,平均提升幅度为 +1.1%。总体而言,本工作为乳腸钼化提供了视觉-语言模型,凸显了乳腸钼化图谱文本信息的价值。此外,我们公开了 TEKNOFEST 数据集的预处理乳腸钼化图像。训练代码、预训练模型权重、数据提取脚本及发布的数据集已全部公开于:https://github.com/igulluk/MAM-CLIP。

关键词

引用

@article{arxiv.2605.19359,
  title  = {MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification},
  author = {Halil Ibrahim Gulluk and Olivier Gevaert},
  journal= {arXiv preprint arXiv:2605.19359},
  year   = {2026}
}