中文

过参数化似然模型的渐近风险:深度神经网络的双下降理论

机器学习 2021-03-16 v2 机器学习 统计理论 统计理论

摘要

我们研究了一类通用过参数化似然模型(包括深度模型)的渐近风险。近期大规模模型的经验成功促使若干理论研究去考察样本数nn和参数数pp均趋于无穷的场景,并推导出极限处的渐近风险。然而,这些定理仅对线性特征模型(如广义线性回归、核回归和浅层神经网络)有效。因此,难以研究更广类的非线性模型,包括三层及以上的深度神经网络。本研究中,我们考虑无模型约束的似然最大化问题,并分析了带惩罚估计量的渐近风险上界。在技术上,我们将Fisher信息矩阵的性质与扩展的Marchenko-Pastur律相结合,并将该结合与经验过程技术相关联。所推导的界具有一般性,因为它根据惩罚项描述了双下降与正则化风险曲线。我们的结果在无模型线性特征约束下成立,并允许我们从似然推导出Fisher信息矩阵的一般谱分布。我们展示了若干显式模型,如并行深度神经网络、集成学习和残差网络,均与我们的理论一致。该结果表明,即便大型深度模型,若具备如可分离性的特定结构,其渐近风险也很小。为验证此发现,我们使用并行深度神经网络进行了真实数据实验。我们的结果扩展了渐近风险分析的适用性,并可能有助于深度学习的理解与应用。

关键词

引用

@article{arxiv.2103.00500,
  title  = {Asymptotic Risk of Overparameterized Likelihood Models: Double Descent Theory for Deep Neural Networks},
  author = {Ryumei Nakada and Masaaki Imaizumi},
  journal= {arXiv preprint arXiv:2103.00500},
  year   = {2021}
}

备注

36 pages