ConvNeXt 与视觉-语言模型在筛查乳腺 X 线摄影中乳腺密度评估中的比较
图像与视频处理
2025-06-18 v1 机器学习
摘要
乳腺 X 线摄影中的乳腺密度分类对癌症风险评估至关重要,但由于主观解读与观察者间差异,这一任务仍具挑战性。本研究在 BI-RADS 体系下比较了多模态方法与基于 CNN 的方法用于自动分类,在三种学习场景下评估了 BioMedCLIP 与 ConvNeXt:零样本分类、结合文本描述的线性探测,以及使用数值标签的微调。结果显示,零样本分类取得了中等水平的性能,而微调后的 ConvNeXt 模型优于 BioMedCLIP 的线性探测。尽管线性探测借助预训练嵌入展现了一定潜力,但其效果仍不及完全微调。这些发现表明,尽管多模态学习前景广阔,但采用端到端微调的基于 CNN 的模型在专业医学影像任务中能够提供更强的性能。本研究强调了未来放射学应用中需要更细致的文本表征以及领域特定的适配。
引用
@article{arxiv.2506.13964,
title = {Comparison of ConvNeXt and Vision-Language Models for Breast Density Assessment in Screening Mammography},
author = {Yusdivia Molina-Román and David Gómez-Ortiz and Ernestina Menasalvas-Ruiz and José Gerardo Tamez-Peña and Alejandro Santos-Díaz},
journal= {arXiv preprint arXiv:2506.13964},
year = {2025}
}
备注
6 pages, 4 figures