中文

全局最优非凸神经网络训练的泛化界:基于无限维 Langevin 动力学的传输映射估计

机器学习 2020-10-28 v2 机器学习

摘要

我们引入一个新的理论框架来分析深度学习优化及其与泛化误差的联系。现有的用于神经网络优化分析的框架,如平均场理论与神经正切核理论,通常要求取网络无限宽度的极限以展示其全局收敛性。这 potentially 使得直接处理有限宽度网络变得困难;尤其在神经正切核机制下,我们无法揭示神经网络超越核方法的有利性质。为实现更自然的分析,我们考虑一种完全不同的方法,将参数训练表述为传输映射估计,并通过无限维 Langevin 动力学理论展示其全局收敛性。这使我们能以统一方式分析窄与宽网络。此外,我们给出了该动力学所得解的泛化差距与超额风险界。超额风险界达到了所谓的快速学习率。特别地,我们展示了一个分类问题的指数收敛性与一个回归问题的极小极大最优率。

关键词

引用

@article{arxiv.2007.05824,
  title  = {Generalization bound of globally optimal non-convex neural network training: Transportation map estimation by infinite dimensional Langevin dynamics},
  author = {Taiji Suzuki},
  journal= {arXiv preprint arXiv:2007.05824},
  year   = {2020}
}

备注

Accepted in NeurIPS2020 (Thirty-fourth Conference on Neural Information Processing Systems)