中文

面向医学影像中Vision Transformer解释方法的评估

计算机视觉与模式识别 2023-11-09 v1 机器学习

摘要

随着深度学习模型在医学影像等关键领域的应用日益增多,对透明且可信决策的需求变得至关重要。许多可解释性方法通过为输入特征分配重要性来提供对这些模型如何预测的洞察。由于Vision Transformer (ViT)成为卷积神经网络用于图像分类的有前景的替代方案,其可解释性仍是一个开放的研究问题。本文研究了多种解释方法在用于分类胸部X射线图像的ViT上的性能。我们引入了评估ViT解释的忠实性、敏感性和复杂性的概念。所得结果表明,面向变换器的逐层相关性传播优于局部可解释模型无关解释和注意力可视化,提供了对ViT实际所学内容更准确可靠的表征。我们的发现为ViT解释在医学影像中的适用性提供了见解,并强调了使用恰当评估标准进行比较的重要性。

关键词

引用

@article{arxiv.2304.06133,
  title  = {Towards Evaluating Explanations of Vision Transformers for Medical Imaging},
  author = {Piotr Komorowski and Hubert Baniecki and Przemysław Biecek},
  journal= {arXiv preprint arXiv:2304.06133},
  year   = {2023}
}

备注

Accepted by XAI4CV Workshop at CVPR 2023