中文

基于蒸馏辅助可学习方法的无梯度事后可解释性

人工智能 2024-09-18 v1 计算机视觉与模式识别 机器学习 图像与视频处理

摘要

人工智能(AI)的最新进展,随着多个仅提供查询访问的大型模型的发布,为以事后无梯度方式解释深度模型提供了强有力的理由。在本文中,我们提出了一个名为蒸馏辅助可解释性(DAX)的框架,该框架试图在模型无关的无梯度应用中生成基于显著性的解释。DAX 方法将解释问题置于一个可学习的环境中,包含一个掩码生成网络和一个蒸馏网络。掩码生成网络学习生成乘数掩码,以找到输入的显著区域,而学生蒸馏网络旨在近似黑盒模型的局部行为。我们提出在 DAX 框架中,使用局部扰动的输入样本,并利用从黑盒模型的输入-输出访问中导出的目标,对这两个网络进行联合优化。我们在分类设置下,跨不同模态(图像和音频),使用多种评估方法(与真实值的交并比、基于删除的度量以及基于主观人类评估的度量)对 DAX 进行了广泛评估,并将其与 9 种不同方法进行了基准测试。在这些评估中,DAX 在所有模态和评估指标上均显著优于现有方法。

关键词

引用

@article{arxiv.2409.11123,
  title  = {Gradient-free Post-hoc Explainability Using Distillation Aided Learnable Approach},
  author = {Debarpan Bhattacharya and Amir H. Poorjam and Deepak Mittal and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2409.11123},
  year   = {2024}
}

备注

12 pages, 10 figures, Accepted in IEEE Journal of Selected Topics in Signal Processing (JSTSP), 2024