关于无限宽神经网络的精确计算
机器学习
2019-11-05 v2 计算机视觉与模式识别
神经与进化计算
机器学习
摘要
当经典深度网络架构(如AlexNet或VGG19)的宽度——即卷积层中的通道数和全连接内部层中的节点数——被允许增加到无穷大时,其在CIFAR-10等标准数据集上的分类表现如何?此类问题已在理论上理解深度学习及其优化与泛化之谜的探索中走到前沿。它们也将深度学习与高斯过程和核等概念相联系。近期论文[Jacot et al., 2018]引入了神经切线核(NTK),刻画了由梯度下降训练的全连接深度网络在无限宽度极限下的行为;该对象在其他一些近期论文中隐式存在。此类思想的一个吸引力在于,使用纯基于核的方法即可捕捉无限宽全训练深度网络的威力。本文给出了计算NTK向卷积神经网络扩展的首个高效精确算法,我们称之为卷积NTK(CNTK),以及该算法的高效GPU实现。这结果为纯基于核的方法在CIFAR-10上的性能树立了重要新基准,比[Novak et al., 2019]中报道的方法高,且仅比相应有限深度网络架构(一旦关闭批归一化等)的性能低。理论上,我们也给出了首个非渐近证明,表明充分宽的全训练网络确实等价于使用NTK的核回归预测器。
引用
@article{arxiv.1904.11955,
title = {On Exact Computation with an Infinitely Wide Neural Net},
author = {Sanjeev Arora and Simon S. Du and Wei Hu and Zhiyuan Li and Ruslan Salakhutdinov and Ruosong Wang},
journal= {arXiv preprint arXiv:1904.11955},
year = {2019}
}
备注
In NeurIPS 2019. Code available: https://github.com/ruosongwang/cntk