中文

医学影像中视觉转换器可解释性评估

计算机视觉与模式识别 2025-10-15 v1

摘要

理解模型决策在医学影像中至关重要,解释性直接影响临床信任和采纳。视觉转换器(ViT)在诊断性医学影像中展现出领先的性能;然而,其复杂的注意力机制对可解释性构成挑战。本研究评估了不同视觉转换器架构和预训练策略——ViT、DeiT、DINO 和 Swin Transformer——的可解释性,分别使用 Gradient Attention Rollout 和 Grad-CAM。我们对两种医学影像任务进行定性和定量分析:周围血细胞分类和乳腺超声图像分类。我们的发现表明,DINO 结合 Grad-CAM 在数据集上提供最具忠实性和局部化的解释。Grad-CAM 持续产生具有类别判别性和空间精确的热图,而 Gradient Attention Rollout 产生更分散的激活。即使在误分类情况下,DINO 与 Grad-CAM 也突出显示了看似误导模型的临床相关形态特征。通过提高模型透明度,该研究支持 ViT 可靠且可解释地集成到关键医学诊断工作流程中。

关键词

引用

@article{arxiv.2510.12021,
  title  = {Evaluating the Explainability of Vision Transformers in Medical Imaging},
  author = {Leili Barekatain and Ben Glocker},
  journal= {arXiv preprint arXiv:2510.12021},
  year   = {2025}
}

备注

Accepted at Workshop on Interpretability of Machine Intelligence in Medical Image Computing at MICCAI 2025