中文

深度学习解释方法的显著性图评估指标

计算机视觉与模式识别 2022-06-23 v3 人工智能

摘要

由于深度学习模型具有黑盒性质,近期出现了许多用于 CNN 视觉解释的解决方案。鉴于用户研究成本高昂,需要使用指标来比较和评估这些不同的方法。在本文中,我们批判性地分析了 Petsiuk 等人 (2018) 提出的 Deletion Area Under Curve (DAUC) 和 Insertion Area Under Curve (IAUC) 指标。这些指标旨在评估由 Grad-CAM 或 RISE 等通用方法生成的显著性图的保真度。首先,我们表明显著性图给出的实际显著性分数值被忽略了,因为仅考虑了分数的排序。这表明这些指标本身是不充分的,因为显著性图的视觉外观可以在不修改分数排序的情况下发生显著变化。其次,我们论证了在计算 DAUC 和 IAUC 期间,模型被输入了训练分布之外的图像,这可能导致被解释模型的行为不可靠。为了补充 DAUC/IAUC,我们提出了新的指标来量化解释方法的稀疏性和校准,这是两个此前未被研究的属性。最后,我们对本文研究的指标给出了一般性评述,并讨论了如何在用户研究中评估它们。

关键词

引用

@article{arxiv.2201.13291,
  title  = {Metrics for saliency map evaluation of deep learning explanation methods},
  author = {Tristan Gomez and Thomas Fréour and Harold Mouchère},
  journal= {arXiv preprint arXiv:2201.13291},
  year   = {2022}
}