刻画深度神经网络激活空间的形状
机器学习
2019-05-31 v2 密码学与安全
机器学习
摘要
深度神经网络学到的表示难以解释,部分原因在于其巨大的参数空间以及多层结构引入的复杂性。我们提出了一种在神经网络图结构激活上计算持续同调的方法,从而能够获取给定输入下整个网络中被激活的与任务相关的子结构。这一拓扑视角通过激活结构形状,对神经网络编码的分布式表示提供了独特的洞察。我们通过给出对抗样本存在性的另一种解释来展示该方法的价值。通过研究多种架构与数据集上网络激活的拓扑结构,我们发现对抗扰动并不会如先前假设那样添加针对对抗类别语义结构的激活。相反,对抗样本可解释为对原始图像所诱导的主导激活结构的改动,表明深度网络学到的类别表示在输入空间上存在着有问题的稀疏性。
引用
@article{arxiv.1901.09496,
title = {Characterizing the Shape of Activation Space in Deep Neural Networks},
author = {Thomas Gebhart and Paul Schrater and Alan Hylton},
journal= {arXiv preprint arXiv:1901.09496},
year = {2019}
}