识别 Transformer 医学影像模型中进行准确预测所必需的关键标记
计算机视觉与模式识别
2025-01-28 v1 人工智能
摘要
随着自监督学习(SSL)的发展,基于 Transformer 的计算机视觉模型最近在人工智能(AI)驱动的医学影像领域展现出优于卷积神经网络(CNN)的优异性能,并将在未来主导该领域。然而,类似于 CNN,揭示基于 Transformer 模型决策过程的挑战依旧。本文致力于解密基于 Transformer 的医学影像模型的决策过程,提出了一种新颖方法称为 Token Insight,用于识别贡献于模型做出预测的关键标记。我们的方法基于 Transformer 模型固有的标记丢弃原则,无需额外模块,可适用于任何 Transformer 模型。通过所提出的方法,我们基于其对预测的贡献量化每个标记的重要性,从而实现对模型决策更细致的理解。我们的实验结果在基于监督和自监督预训练的视觉 Transformer 模型上用于结肠息肌识别问题上表明,Token Insight 有助于构建更透明和可解释的基于 Transformer 的医学影像模型,促进信任并推动其在临床环境中广泛采用。
关键词
引用
@article{arxiv.2501.15452,
title = {Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models},
author = {Solha Kang and Joris Vankerschaver and Utku Ozbulak},
journal= {arXiv preprint arXiv:2501.15452},
year = {2025}
}
备注
Accepted for publication in MICCAI 2024 Workshop on Machine Learning in Medical Imaging (MLMI)