中文

用于医学诊断的稳定视觉概念 Transformer

计算机视觉与模式识别 2025-06-06 v1 机器学习

摘要

透明度是医学领域的首要关切,促使研究者深入探索可解释人工智能 (XAI) 领域。在这些 XAI 方法中,概念瓶颈模型 (CBMs) 旨在通过生成概念层提取概念特征,将模型的隐空间限制在人类可理解的高层概念上,近期受到广泛关注。然而,现有方法仅依赖概念特征来决定模型预测,忽略了医学图像中的内在特征嵌入。为弥补原始模型与基于概念的模型之间的效用差距,我们提出视觉概念 Transformer (VCT)。此外,尽管 CBMs 有诸多益处,但研究发现它们在面对输入扰动时会负面影响模型性能且无法提供稳定的解释,这限制了其在医学领域的应用。为解决这一忠实性问题,本文进一步提出基于 VCT 的稳定视觉概念 Transformer (SVCT),它以视觉 Transformer (ViT) 为骨干并融入概念层。SVCT 通过将概念特征与图像特征融合来增强决策能力,并通过整合去噪扩散平滑来确保模型忠实性。在四个医学数据集上的全面实验表明,我们的 VCT 和 SVCT 在保持准确性的同时相比基线保持了可解释性。此外,即使在受到扰动时,我们的 SVCT 模型也能持续提供忠实的解释,从而满足医学领域的需求。

关键词

引用

@article{arxiv.2506.05286,
  title  = {Stable Vision Concept Transformers for Medical Diagnosis},
  author = {Lijie Hu and Songning Lai and Yuan Hua and Shu Yang and Jingfeng Zhang and Di Wang},
  journal= {arXiv preprint arXiv:2506.05286},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2304.06129 by other authors