中文

利用信息论考察深度神经网络的因果结构

机器学习 2020-10-28 v1 人工智能

摘要

深度神经网络 (DNNs) 常在其对输入响应的层面被考察,例如分析节点与数据集之间的互信息。然而 DNNs 也可以在因果层面被考察,探索网络各层内部的“谁作用于谁”。历史上,分析 DNNs 的因果结构所受关注少于理解其对输入的响应。但从定义上说,泛化能力必定是 DNN 因果结构的函数,因为它反映了 DNN 如何响应未见过的甚至尚未定义的未来输入。在此,我们引入一套基于信息论的度量来量化和追踪训练期间 DNN 因果结构的变化。具体而言,我们引入前馈 DNN 的有效信息 (EI),即最大熵扰动后层输入与输出之间的互信息。EI 可用于评估各层中节点和边对其下游目标的因果影响程度。我们展示 EI 可进一步分解,以考察层的敏感性(由边传输扰动的优劣度量)和层的简并性(由边重叠对传输的干扰度量),以及对层集成信息的估计。这些属性共同定义了每层在“因果平面”中的位置,可用于可视化层连接随时间如何变得更敏感或更简并,以及集成信息在训练期间如何变化,从而揭示逐层因果结构如何分化。这些结果可能有助于理解 DNN 的泛化能力,并为使 DNN 更具泛化性和可解释性提供基础工具。

关键词

引用

@article{arxiv.2010.13871,
  title  = {Examining the causal structures of deep neural networks using information theory},
  author = {Simon Mattsson and Eric J. Michaud and Erik Hoel},
  journal= {arXiv preprint arXiv:2010.13871},
  year   = {2020}
}

备注

14 pages, 8 figures