中文

如何选择 CNN 模型的最佳基于 CAM 的可解释性方法?

机器学习 2026-05-05 v1 计算机视觉与模式识别

摘要

近年来,深度学习取得了诸多进展,呈现出惊人结果。该领域的模型越来越多地被用于诸多应用,包括涉及人类生命的敏感场景,这些场景需要清晰的解释和依据。虽然提出了各种可解释性方法,但用于评估这些方法的指标并不多。最常用的指标是交并比 (IoU)。然而,由于可解释性方法结果(称为灵敏度图)的特性——即它们没有确定的形状——我们假设必须存在更好的指标,能够找到能够最贴近人类感知的可解释性方法。我们提议使用不同的指标来评估人类感知与解释灵敏度图之间的相似性,以寻找更好的指标。通过在 ImageNet 数据集的子集上进行实验,采用众包方式收集的人类选择结果来评估。我们使用多种 CAM 基于可解释性方法为每张 chihuahua 图像生成灵敏度图。通过应用距离度量标准计算人类注释边界框与各可解释方法生成的灵敏度图之间的对齐程度。使用距离度量结果创建最佳灵敏度图的排名,并与通过众包收集的人类对每张选定图像最佳解释灵敏度图的选择结果进行比较。使用排名双重重叠 (RBO) 指标进行排名间的比较。结果表明,我们的方法是可行的,能够找到最贴近人类感知的可解释性方法。在实验中,两种最贴近人类感知的指标分别是曼哈顿距离和相关系数。此外,关于人类感知的最佳可解释性方法是 LayerCAM、Score-CAM 和 IS-CAM。

关键词

引用

@article{arxiv.2605.02007,
  title  = {How Can One Choose the Best CAM-Based Explainability Method for a CNN Model?},
  author = {Daniel da Silva Costa and Pedro Nuno de Souza Moura and Adriana C. F. Alvim},
  journal= {arXiv preprint arXiv:2605.02007},
  year   = {2026}
}

备注

Accepted in the 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC). 8 pages, 4 figures and 7 tables. Code is available at: https://github.com/danieldasilvacosta/choose-best-cam-based-xai-method-cnn-model