中文

理解深度 CNN 的泛化与优化性能

机器学习 2018-05-29 v1 最优化与控制 统计理论 机器学习 统计理论

摘要

本工作旨在通过理论分析深度卷积神经网络(CNN)的泛化性能并建立基于梯度下降的训练算法的优化保证,来对其显著成功提供理解。具体而言,对于一个由 ll 个卷积层和一个全连接层组成的 CNN 模型,我们证明其泛化误差被 O(\dtϱ~/n)\mathcal{O}(\sqrt{\dt\widetilde{\varrho}/n}) 所界定,其中 θ\theta 表示网络参数的自由度,ϱ~=O(log(i=1l\rwii(\kii\sii+1)/p)+log(\rf))\widetilde{\varrho}=\mathcal{O}(\log(\prod_{i=1}^{l}\rwi{i} (\ki{i}-\si{i}+1)/p)+\log(\rf)) 封装了架构参数,包括核大小 \kii\ki{i}、步长 \sii\si{i}、池化大小 pp 和参数幅度 \rwii\rwi{i}。据我们所知,这是首个仅依赖于 O(log(i=1l+1\rwii))\mathcal{O}(\log(\prod_{i=1}^{l+1}\rwi{i})) 的泛化界,比现有的均包含如 O(i=1l+1\rwii)\mathcal{O}(\prod_{i=1}^{l+1}\rwi{i}) 这类指数项的界更紧。此外,我们证明对于任意梯度下降算法,通过最小化经验风险计算出的近似驻点也是总体风险的近似驻点。这很好地解释了为何梯度下降训练算法在实践中通常表现足够好。进一步,我们证明了经验风险与总体风险之间非退化驻点的一一对应性及收敛保证。这意味着经验风险的 computed 局部极小也接近总体风险的局部极小,从而确保了 CNN 的良好泛化性能。

关键词

引用

@article{arxiv.1805.10767,
  title  = {Understanding Generalization and Optimization Performance of Deep CNNs},
  author = {Pan Zhou and Jiashi Feng},
  journal= {arXiv preprint arXiv:1805.10767},
  year   = {2018}
}

备注

This paper was accepted by ICML. It has 38 pages