中文

激活-去激活:一种用于鲁棒后处理可解释人工智能的通用框架

人工智能 2025-10-02 v1 计算机视觉与模式识别 机器学习

摘要

黑箱可解释性方法是解释图像分类器决策的流行工具,其主要缺点是依赖于通过遮蔽输入部分来获取的突变体,导致出现分布之外的图像,进而动摇解释质量。此外,选择合适的遮蔽值常需依赖领域知识。本文引入一种新的前向传递范式激活-去激活(Activation-Deactivation, AD),通过关闭与遮蔽输入特征对应的模型部分,从而消除被遮蔽输入特征对模型决策的影响。我们提出 ConvAD,这种一种可轻松添加到任何已训练卷积神经网络(CNN)中的即插即用机制,实现 AD 范式。这导致在无需额外训练或微调的情况下获得更鲁棒的解释。我们证明 ConvAD 机制不会改变网络的决策过程。我们在多个数据集和模型架构上进行实验评估。我们将 AD 解释质量与使用不同遮蔽值获得的解释进行比较,利用鲁棒性、大小和置信度下降等代理指标。我们观察到,与使用遮蔽获得的解释相比,AD 解释在鲁棒性上持续性改善(最高可达 62.5%),表明 ConvAD 在无需领域知识的情况下提取了更鲁棒的解释。

关键词

引用

@article{arxiv.2510.01038,
  title  = {Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI},
  author = {Akchunya Chanchal and David A. Kelly and Hana Chockler},
  journal= {arXiv preprint arXiv:2510.01038},
  year   = {2025}
}

备注

Preprint: Under Review