中文

深度神经网络中信息流的估计

机器学习 2019-05-31 v4 机器学习

摘要

我们研究深度神经网络(DNN)训练过程中的信息流与内部表示演化,旨在揭示信息瓶颈理论中压缩方面的神秘面纱。该理论指出 DNN 训练包含一个快速的拟合阶段,随后是一个较慢的压缩阶段,其中输入 XX 与内部表示 TT 之间的互信息 I(X;T)I(X;T) 减小。若干论文在不同 DNN 模型上观察到估计互信息的压缩,但这些网络上的真实 I(X;T)I(X;T) 可被证明要么为常数(离散 XX),要么为无穷(连续 XX)。本工作解释了理论与实验间的分歧,并澄清了过去工作实际测量了什么。为此,我们引入一个辅助(含噪)DNN 框架,其中 I(X;T)I(X;T) 是一个依赖于网络参数的有意义量。该含噪框架被证明在性能和所学表示方面均是原始(确定性)DNN 的良好代理。随后我们为含噪 DNN 中的 I(X;T)I(X;T) 开发了严格的估计器,并在多种模型中观察到压缩。通过将含噪 DNN 中的 I(X;T)I(X;T) 与信息论通信问题相关联,我们表明压缩是由同一类输入隐藏表示的渐进聚类所驱动。我们采用若干直接监测隐藏表示聚类的方法(在含噪与确定性 DNN 中均适用),以展示在 TT 空间中形成了有意义的聚类。最后,我们回到过去工作所用的 I(X;T)I(X;T) 估计器,并证明尽管它未能捕捉真实的(空洞的)互信息,但它确实可作为聚类的度量。这澄清了过去观察到的压缩现象,并将隐藏表示的几何聚类隔离为真正值得关注的现象。

关键词

引用

@article{arxiv.1810.05728,
  title  = {Estimating Information Flow in Deep Neural Networks},
  author = {Ziv Goldfeld and Ewout van den Berg and Kristjan Greenewald and Igor Melnyk and Nam Nguyen and Brian Kingsbury and Yury Polyanskiy},
  journal= {arXiv preprint arXiv:1810.05728},
  year   = {2019}
}

备注

Main text accepted to ICML 2019. This preprint contains the full version of that paper (including omitted appendices)