中文

为黑盒着色:用自内省模型可视化神经网络行为

机器学习 2019-10-16 v2 计算机视觉与模式识别 神经与进化计算

摘要

以下工作展示了对于一个给定问题自编码网络所有可能的隐藏激活如何能提供关于其结构、行为和漏洞的洞察。该方法称为自内省(self-introspection),可以表明训练好的模型在看到属于同一类别的数据时展现出相似的激活模式(尽管由于初始化而随机分布),并且分类错误发生在激活未明确定义的边缘区域,表明深度网络内部发生了某种形式的随机的、缓慢变化的隐式编码,可通过该表示观察到。此外,获得所有激活的低维表示允许(1)在多类分类问题背景下的实时模型评估,(2)按隐藏层在获得特定输出中的相关性重新排列所有隐藏层,以及(3)获得一个可研究针对噪声和对抗攻击的可能对策的框架。自内省可以展示受损输入数据如何修改隐藏激活,产生错误响应。针对前馈和卷积模型以及MNIST和CIFAR-10数据集实现了一些说明性示例,展示了其作为模型评估框架的能力。

关键词

引用

@article{arxiv.1910.04903,
  title  = {Coloring the Black Box: Visualizing neural network behavior with a self-introspective model},
  author = {Arturo Pardo and José A. Gutiérrez-Gutiérrez and José Miguel López-Higuera and Brian W. Pogue and Olga M. Conde},
  journal= {arXiv preprint arXiv:1910.04903},
  year   = {2019}
}

备注

16 pages, 7 figures