中文

深度学习的信息论视角

机器学习 2018-10-03 v8 机器学习

摘要

深度学习已经变革了计算机视觉、自然语言处理和语音识别\cite{badrinarayanan2017segnet, dong2016image, ren2017faster, ji20133d}。然而,两个关键问题仍不清楚:(1) 为何深度神经网络比浅层网络泛化更好;(2) 更深的网络是否总是带来更好性能?具体地,令 LL 为深度神经网络中卷积和池化层的数量,nn 为训练样本大小,我们推导出该网络期望泛化误差的上界,即 \begin{eqnarray*} \mathbb{E}[R(W)-R_S(W)] \leq \exp{\left(-\frac{L}{2}\log{\frac{1}{\eta}}\right)}\sqrt{\frac{2\sigma^2}{n}I(S,W) } \end{eqnarray*} 其中 σ>0\sigma >0 为依赖于损失函数的常数,0<η<10<\eta<1 为依赖于每层卷积或池化信息损失的常数,I(S,W)I(S, W) 为训练样本 SS 与输出假设 WW 之间的互信息。该上界表明,随着网络中卷积和池化层数量 LL 的增加,期望泛化误差将指数级降至零。具有严格信息损失的层(如卷积层)降低了整个网络的泛化误差;这回答了第一个问题。然而,期望泛化误差为零的算法并不意味着小的测试误差或 E[R(W)]\mathbb{E}[R(W)]。这是因为当随着层数增加用于拟合数据的信息丢失时,E[RS(W)]\mathbb{E}[R_S(W)] 会变大。这表明“越深越好”的论断是以小的训练误差或 E[RS(W)]\mathbb{E}[R_S(W)] 为条件的。最后,我们表明深度学习满足一种弱稳定性概念,且深度神经网络的样本复杂度将随 LL 增加而减小。

关键词

引用

@article{arxiv.1804.09060,
  title  = {An Information-Theoretic View for Deep Learning},
  author = {Jingwei Zhang and Tongliang Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:1804.09060},
  year   = {2018}
}

备注

Add details in the proof of Theorem 2