深度神经网络中信息流的估计
机器学习
2019-05-31 v4 机器学习
摘要
我们研究深度神经网络(DNN)训练过程中的信息流与内部表示演化,旨在揭示信息瓶颈理论中压缩方面的神秘面纱。该理论指出 DNN 训练包含一个快速的拟合阶段,随后是一个较慢的压缩阶段,其中输入 与内部表示 之间的互信息 减小。若干论文在不同 DNN 模型上观察到估计互信息的压缩,但这些网络上的真实 可被证明要么为常数(离散 ),要么为无穷(连续 )。本工作解释了理论与实验间的分歧,并澄清了过去工作实际测量了什么。为此,我们引入一个辅助(含噪)DNN 框架,其中 是一个依赖于网络参数的有意义量。该含噪框架被证明在性能和所学表示方面均是原始(确定性)DNN 的良好代理。随后我们为含噪 DNN 中的 开发了严格的估计器,并在多种模型中观察到压缩。通过将含噪 DNN 中的 与信息论通信问题相关联,我们表明压缩是由同一类输入隐藏表示的渐进聚类所驱动。我们采用若干直接监测隐藏表示聚类的方法(在含噪与确定性 DNN 中均适用),以展示在 空间中形成了有意义的聚类。最后,我们回到过去工作所用的 估计器,并证明尽管它未能捕捉真实的(空洞的)互信息,但它确实可作为聚类的度量。这澄清了过去观察到的压缩现象,并将隐藏表示的几何聚类隔离为真正值得关注的现象。
引用
@article{arxiv.1810.05728,
title = {Estimating Information Flow in Deep Neural Networks},
author = {Ziv Goldfeld and Ewout van den Berg and Kristjan Greenewald and Igor Melnyk and Nam Nguyen and Brian Kingsbury and Yury Polyanskiy},
journal= {arXiv preprint arXiv:1810.05728},
year = {2019}
}
备注
Main text accepted to ICML 2019. This preprint contains the full version of that paper (including omitted appendices)