中文

识别 Transformer 医学影像模型中进行准确预测所必需的关键标记

计算机视觉与模式识别 2025-01-28 v1 人工智能

摘要

随着自监督学习(SSL)的发展,基于 Transformer 的计算机视觉模型最近在人工智能(AI)驱动的医学影像领域展现出优于卷积神经网络(CNN)的优异性能,并将在未来主导该领域。然而,类似于 CNN,揭示基于 Transformer 模型决策过程的挑战依旧。本文致力于解密基于 Transformer 的医学影像模型的决策过程,提出了一种新颖方法称为 Token Insight,用于识别贡献于模型做出预测的关键标记。我们的方法基于 Transformer 模型固有的标记丢弃原则,无需额外模块,可适用于任何 Transformer 模型。通过所提出的方法,我们基于其对预测的贡献量化每个标记的重要性,从而实现对模型决策更细致的理解。我们的实验结果在基于监督和自监督预训练的视觉 Transformer 模型上用于结肠息肌识别问题上表明,Token Insight 有助于构建更透明和可解释的基于 Transformer 的医学影像模型,促进信任并推动其在临床环境中广泛采用。

关键词

引用

@article{arxiv.2501.15452,
  title  = {Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models},
  author = {Solha Kang and Joris Vankerschaver and Utku Ozbulak},
  journal= {arXiv preprint arXiv:2501.15452},
  year   = {2025}
}

备注

Accepted for publication in MICCAI 2024 Workshop on Machine Learning in Medical Imaging (MLMI)