中文

通过信息打开深度神经网络的黑箱

机器学习 2017-05-02 v3

摘要

尽管深度神经网络(DNN)取得了巨大成功,但目前对 DNN 的学习或其内部组织仍缺乏全面的理论理解。先前的工作提出在信息平面中分析 DNN,即每一层在输入和输出变量上保持的互信息值所构成的平面。他们提出,网络的目标是逐层优化压缩与预测之间的信息瓶颈(IB)权衡。在本工作中,我们延续这一思路,并展示了 DNN 信息平面可视化的有效性。我们的主要结果为:(i) 标准 DL 中的大部分训练周期用于将输入压缩为高效表示,而非拟合训练标签。(ii) 表示压缩阶段始于训练误差变小之时,此时随机梯度下降(SGD)周期从向更小训练误差的快速漂移转变为受训练误差值约束的随机弛豫或随机扩散。(iii) 收敛后的层位于或非常接近信息瓶颈(IB)理论界,且从输入到任意隐藏层以及从该隐藏层到输出的映射满足 IB 自洽方程。这种通过噪声机制实现的泛化为深度神经网络所独有,在单层网络中不存在。(iv) 增加更多隐藏层时训练时间显著减少。因此,隐藏层的主要优势在于计算方面。这可以通过弛豫时间的减少来解释,因为它随上一层的信息压缩呈超线性(对简单扩散呈指数)缩放。

关键词

引用

@article{arxiv.1703.00810,
  title  = {Opening the Black Box of Deep Neural Networks via Information},
  author = {Ravid Shwartz-Ziv and Naftali Tishby},
  journal= {arXiv preprint arXiv:1703.00810},
  year   = {2017}
}

备注

19 pages, 8 figures