中文

Mammo-CLIP Dissect:分析哺乳动物图像概念的框架

计算机视觉与模式识别 2025-09-26 v1

摘要

理解深度学习(DL)模型学习的内容对于人工智能在临床应用中安全部署至关重要。虽然先前工作关注像素级可解释性方法,但对这些模型所学习的文本概念所采用的注意力仍较少,后者可能更能反映临床医生的推理方式。我们引入Mammo-CLIP Dissect,这是首个针对乳腺图像深度学习视觉模型的概念基解释性框架。利用针对乳腺图像专用的视觉语言模型(Mammo-CLIP)作为“解剖工具”,我们的 approach 在指定图层标记神经元与人类可解释文本概念,并量化其与领域知识的对齐程度。利用Mammo-CLIP Dissect,我们调查了三个关键问题:(1)针对普通图像数据集训练的DL视觉模型与针对乳腺图像数据集训练的模型之间的概念学习差异;(2)针对下游乳腺图像任务进行微调如何影响概念特化;(3)哪些乳腺图像相关概念不足。我们表明,训练于乳腺图像数据的模型捕获更多临床相关概念,并更贴近放射科医生的工作流程;针对特定任务进行微调可提升某些概念类别(如良性钙化)的捕获,但可能降低其他概念的覆盖范围(如密度相关特征),表明特化与泛化之间存在权衡。我们的发现表明,Mammo-CLIP Dissect为揭示卷积神经网络(CNN)如何捕获乳腺图像特定知识提供了洞见。通过比较不同训练数据和微调方案下的模型,我们揭示了领域特定训练和任务特定适应如何塑造概念学习。代码和概念集合均可用:https://github.com/Suaiba/Mammo-CLIP-Dissect。

关键词

引用

@article{arxiv.2509.21102,
  title  = {Mammo-CLIP Dissect: A Framework for Analysing Mammography Concepts in Vision-Language Models},
  author = {Suaiba Amina Salahuddin and Teresa Dorszewski and Marit Almenning Martiniussen and Tone Hovda and Antonio Portaluri and Solveig Thrun and Michael Kampffmeyer and Elisabeth Wetzer and Kristoffer Wickstrøm and Robert Jenssen},
  journal= {arXiv preprint arXiv:2509.21102},
  year   = {2025}
}