链式法则相遇链式方法:多层熵正则化与神经网络训练
机器学习
2019-06-27 v1 信息论
math.IT
机器学习
摘要
我们利用基于多层相对熵的一系列复杂度度量,推导了神经网络的泛化界和超额风险界。这些界是通过引入神经网络生成分层覆盖的概念,并运用 Asadi 等人在 NeurIPS'18 中提出的链式互信息(chaining mutual information)技术获得的。所得界是算法依赖的,并利用了神经网络的多层结构。这反过来引出了一个带有多层熵正则化的经验风险最小化问题。该最小化问题通过引入著名的 Gibbs 后验分布的多尺度推广得以解决,证明了所推导的分布达到了唯一最小值。这为神经网络带来了一种具有性能保证的新训练过程,该过程利用了相对熵的链式法则(chain rule),而非导数的链式法则(如反向传播中那样)。为了获得后者的高效实现,我们进一步开发了一个多层 Metropolis 算法来模拟多尺度 Gibbs 分布,并在 MNIST 数据集上对两层神经网络进行了实验。
引用
@article{arxiv.1906.11148,
title = {Chaining Meets Chain Rule: Multilevel Entropic Regularization and Training of Neural Nets},
author = {Amir R. Asadi and Emmanuel Abbe},
journal= {arXiv preprint arXiv:1906.11148},
year = {2019}
}
备注
30 pages, 3 figures