中文

通过提取类特定子网络实现神经网络的可解释解耦

机器学习 2019-10-08 v1 机器学习

摘要

我们提出一种以可解释解耦形式理解深度神经网络的新视角。对于每个语义类,我们从原始完整模型中提取一个类特定的功能子网络,其结构经压缩而保持可比较的预测性能。所提取子网络的结构表示与其对应类的语义相似性呈现出相似性。我们还将提取的子网络应用于视觉解释与对抗样本检测任务,仅以类特定子网络替换原始完整模型。实验表明,这一直观操作能有效提升基于梯度的解释方法的解释显著性准确率,并提高基于置信度分数的对抗样本检测方法的检测率。

关键词

引用

@article{arxiv.1910.02673,
  title  = {Interpretable Disentanglement of Neural Networks by Extracting Class-Specific Subnetwork},
  author = {Yulong Wang and Xiaolin Hu and Hang Su},
  journal= {arXiv preprint arXiv:1910.02673},
  year   = {2019}
}

备注

Accepted to 2019 ICCV Workshop on Interpreting and Explaining Visual Artificial Intelligence Models