深度学习的信息论视角
机器学习
2018-10-03 v8 机器学习
摘要
深度学习已经变革了计算机视觉、自然语言处理和语音识别\cite{badrinarayanan2017segnet, dong2016image, ren2017faster, ji20133d}。然而,两个关键问题仍不清楚:(1) 为何深度神经网络比浅层网络泛化更好;(2) 更深的网络是否总是带来更好性能?具体地,令 为深度神经网络中卷积和池化层的数量, 为训练样本大小,我们推导出该网络期望泛化误差的上界,即 \begin{eqnarray*} \mathbb{E}[R(W)-R_S(W)] \leq \exp{\left(-\frac{L}{2}\log{\frac{1}{\eta}}\right)}\sqrt{\frac{2\sigma^2}{n}I(S,W) } \end{eqnarray*} 其中 为依赖于损失函数的常数, 为依赖于每层卷积或池化信息损失的常数, 为训练样本 与输出假设 之间的互信息。该上界表明,随着网络中卷积和池化层数量 的增加,期望泛化误差将指数级降至零。具有严格信息损失的层(如卷积层)降低了整个网络的泛化误差;这回答了第一个问题。然而,期望泛化误差为零的算法并不意味着小的测试误差或 。这是因为当随着层数增加用于拟合数据的信息丢失时, 会变大。这表明“越深越好”的论断是以小的训练误差或 为条件的。最后,我们表明深度学习满足一种弱稳定性概念,且深度神经网络的样本复杂度将随 增加而减小。
引用
@article{arxiv.1804.09060,
title = {An Information-Theoretic View for Deep Learning},
author = {Jingwei Zhang and Tongliang Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:1804.09060},
year = {2018}
}
备注
Add details in the proof of Theorem 2