解释一致性量化:面向医学图像分类的CAM基于解释的C-Score指标
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
类激活映射(CAM)方法广泛用于生成医学影像中深度学习分类器的可视化解释。然而,现有评估框架评估解释是否正确,即通过局部化保真度与放射科医生注释来衡量,而不评估解释是否一致:即模型是否在不同患者、相同病理情况下的相同空间推理策略。我们提出C-Score(一致性得分),是一个以置信度加权、无需注释的指标,通过强调强度的成对软IoU来量化正确分类实例间的解释可重复性。我们在Kermany胸部X光数据集上评估了六种CAM技术:GradCAM、GradCAM++、LayerCAM、EigenCAM、ScoreCAM和MS GradCAM++,覆盖三个CNN架构(DenseNet201、InceptionV3、ResNet50V2),进行30个训练周期,涵盖迁移学习和微调阶段。我们识别出三种AUC一致性解耦机制,这些机制在标准分类指标下不可见:阈值介导的金色名单崩溃、技术特有的归因崩溃在峰值AUC时,以及类级别一致性在全局聚合中的掩蔽。C-Score提供了即将发生模型不稳定的早期警示信号。ScoreCAM在ResNet50V2上的恶化可以在灾难性AUC崩溃前一个完整的checkpoint前检测到,并产生基于解释质量而非预测排序alone的架构特定临床部署建议。
引用
@article{arxiv.2604.08502,
title = {Quantifying Explanation Consistency: The C-Score Metric for CAM-Based Explainability in Medical Image Classification},
author = {Kabilan Elangovan and Daniel Ting},
journal= {arXiv preprint arXiv:2604.08502},
year = {2026}
}