基于注意力的显著图提升气胸分类的可解释性
摘要
目的:以气胸分类为例,研究视觉 transformer(ViT)的胸片(CXR)分类性能及基于注意力的显著图的可解释性。材料与方法:本回顾性研究中,使用四个公共数据集 CheXpert、Chest X-Ray 14、MIMIC CXR 和 VinBigData 对 ViT 进行肺疾病分类微调。使用 transformer 多模态可解释性与梯度加权类激活映射(GradCAM)生成显著图。在 Chest X-Ray 14、VinBigData 和 SIIM-ACR 数据集上采用受试者工作特征曲线下面积分析(AUC)评估分类性能,并与卷积神经网络(CNNs)比较。可解释性方法通过正/负扰动、灵敏度-n、有效热比、架构内重复性与架构间再现性进行评估。在用户研究中,三名放射科医生借助/不借助显著图对 160 张 CXR 进行气胸分类并评价其有用性。结果:ViT 的 CXR 分类 AUC 与最先进 CNN 相当,在 Chest X-Ray 14 上为 0.95(95% CI:0.943, 0.950)对 0.83(95% CI:0.826, 0.842),在 VinBigData 上为 0.84(95% CI:0.769, 0.912)对 0.83(95% CI:0.760, 0.895),在 SIIM ACR 上为 0.85(95% CI:0.847, 0.861)对 0.87(95% CI:0.868, 0.882)。两种显著图方法均揭示模型对气胸引流管存在强烈偏置。放射科医生认为 47% 的基于注意力的显著图有用,39% 的 GradCAM 有用。基于注意力的方法在所有指标上优于 GradCAM。结论:ViT 在 CXR 分类中表现与 CNN 相似,且其基于注意力的显著图对放射科医生更有用并优于 GradCAM。
引用
@article{arxiv.2303.01871,
title = {Attention-based Saliency Maps Improve Interpretability of Pneumothorax Classification},
author = {Alessandro Wollek and Robert Graf and Saša Čečatka and Nicola Fink and Theresa Willem and Bastian O. Sabel and Tobias Lasser},
journal= {arXiv preprint arXiv:2303.01871},
year = {2023}
}