乳腺X线摄影中用于对比语言-图像预训练的多视图与多尺度对齐
计算机视觉与模式识别
2025-03-28 v2 人工智能
机器学习
摘要
对比语言-图像预训练(CLIP)在医学图像分析中展现出巨大潜力,但需要大量的数据和计算资源。由于这些限制,现有的 CLIP 在医学影像中的应用主要集中在胸部 X 光片等具有丰富图像-报告数据的模态上,而许多其他重要的模态尚未得到充分探索。在此,我们提出了将完整 CLIP 模型首次适配到乳腺 X 线摄影的方法之一,由于标记数据稀缺、高分辨率图像中感兴趣区域小以及类别不平衡,这带来了重大挑战。我们首先为乳腺 X 线摄影开发了一个专门的监督框架,利用其多视图特性。此外,我们设计了一个对称的局部对齐模块,以更好地关注高分辨率图像中的细节特征。最后,我们引入了一种参数高效的微调方法,用于在医学知识上预训练的大语言模型,以应对数据限制。我们的多视图和多尺度对齐(MaMA)方法在两个大型真实世界乳腺 X 线摄影数据集 EMBED 和 RSNA-Mammo 上的三项不同任务中均优于最先进的基线方法,且模型大小仅为最大基线的 52%。代码可在 https://github.com/XYPB/MaMA 获取。
引用
@article{arxiv.2409.18119,
title = {Multi-View and Multi-Scale Alignment for Contrastive Language-Image Pre-training in Mammography},
author = {Yuexi Du and John Onofrey and Nicha C. Dvornek},
journal= {arXiv preprint arXiv:2409.18119},
year = {2025}
}
备注
This paper is accepted by IPMI 2025 for Oral Presentation