中文

评估 CNN 中语义概念表示的稳定性以实现鲁棒可解释性

人工智能 2024-04-23 v1 计算机视觉与模式识别 机器学习

摘要

分析卷积神经网络(CNNs)中语义概念的表示方式,是可解释人工智能(XAI)中解释 CNNs 的一种广泛使用的方法。其动机在于安全关键的基于 AI 的系统需要透明度,正如自动驾驶等多个领域所要求的那样。然而,要将概念表示用于安全检查相关目的(如检视或错误检索),这些表示必须具备高质量,尤其是稳定性。本文关注计算机视觉 CNNs 中处理概念表示时的两个稳定性目标:概念检索的稳定性与概念归因的稳定性。指导性用例是面向目标检测(OD)CNNs 的事后可解释性框架,现有概念分析(CA)方法已成功适配于该框架。针对概念检索稳定性,我们提出了一种新颖的度量指标,同时考虑概念分离性与一致性,且与层和概念表示维度无关。随后,我们研究了概念抽象层级、概念训练样本数量、CNN 规模以及概念表示维度对稳定性的影响。对于概念归因稳定性,我们探究了梯度不稳定性对基于梯度的可解释性方法的影响。在多种分类与目标检测 CNNs 上的结果得出主要发现:(1)概念检索的稳定性可通过数据聚合的降维来增强;(2)在梯度不稳定性更明显的浅层,建议使用梯度平滑技术。最后,我们的方法为选择合适的层与概念表示维度提供了宝贵见解,为安全关键 XAI 应用中的 CA 铺平了道路。

关键词

引用

@article{arxiv.2304.14864,
  title  = {Evaluating the Stability of Semantic Concept Representations in CNNs for Robust Explainability},
  author = {Georgii Mikriukov and Gesina Schwalbe and Christian Hellert and Korinna Bade},
  journal= {arXiv preprint arXiv:2304.14864},
  year   = {2024}
}