中文

深度表示中不变性与解耦的涌现

机器学习 2018-06-29 v3 人工智能 机器学习

摘要

运用统计学与信息论中的既定原理,我们证明了深度神经网络对干扰因素的不变性等价于所学表示的信息最小性,并且在训练过程中堆叠层和注入噪声会自然地促使网络偏向于学习不变表示。随后,我们分解了训练期间使用的交叉熵损失,并突出了一个内在过拟合项的存在。我们提出通过两种等价方式对该项进行界定以正则化损失:一种使用 Kullback-Leibler 项,这与 PAC-Bayes 视角相关;另一种使用权重中的信息作为所学模型复杂度的度量,从而产生了一种新颖的权重信息瓶颈。最后,我们证明了网络所学表示的不变性与分量独立性被权重中的信息上下界约束,因此在训练过程中被隐式优化。该理论使我们能够量化和预测在使用我们的正则化损失时,随机标签的欠拟合与过拟合之间的急剧相变,我们在实验中验证了这一点,并阐明了损失函数的几何形状、所学表示的不变性属性与泛化误差之间的关系。

关键词

引用

@article{arxiv.1706.01350,
  title  = {Emergence of Invariance and Disentanglement in Deep Representations},
  author = {Alessandro Achille and Stefano Soatto},
  journal= {arXiv preprint arXiv:1706.01350},
  year   = {2018}
}

备注

Deep learning, neural network, representation, flat minima, information bottleneck, overfitting, generalization, sufficiency, minimality, sensitivity, information complexity, stochastic gradient descent, regularization, total correlation, PAC-Bayes