基于Transformer的医学影像注意力图可视化解释评估
计算机视觉与模式识别
2025-03-13 v1 人工智能
摘要
尽管 Vision Transformers (ViTs) 最近在医学影像问题中展示了优越性能,但它们面临着与先前架构(如卷积神经网络)类似的可解释性问题。最近的研究表明,注意力图作为 ViTs 决策过程的一部分,可以通过识别影响预测的区域来解决可解释性问题,尤其是在使用自监督学习预训练的模型中。在本工作中,我们将注意力图的可视化解释与其他常用于医学影像问题的方法进行了比较。为此,我们使用了四个不同的医学影像数据集,涉及 (1) 结肠息肉、(2) 乳腺肿瘤、(3) 食管炎症和 (4) 骨折及硬件植入物的识别。通过在上述数据集上使用各种监督和自监督预训练的 ViTs 进行大规模实验,我们发现尽管注意力图在某些条件下展现出前景且总体上优于 GradCAM 的可解释性,但它们被变换器专用的可解释性方法所超越。我们的发现表明,注意力图作为一种可解释性方法的有效性是依赖于上下文的,可能有限,因为它们不能始终提供稳健医学决策所需的全面见解。
引用
@article{arxiv.2503.09535,
title = {Evaluating Visual Explanations of Attention Maps for Transformer-based Medical Imaging},
author = {Minjae Chung and Jong Bum Won and Ganghyun Kim and Yujin Kim and Utku Ozbulak},
journal= {arXiv preprint arXiv:2503.09535},
year = {2025}
}
备注
Accepted for publication in MICCAI 2024 Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)