过参数化似然模型的渐近风险:深度神经网络的双下降理论
机器学习
2021-03-16 v2 机器学习
统计理论
统计理论
摘要
我们研究了一类通用过参数化似然模型(包括深度模型)的渐近风险。近期大规模模型的经验成功促使若干理论研究去考察样本数和参数数均趋于无穷的场景,并推导出极限处的渐近风险。然而,这些定理仅对线性特征模型(如广义线性回归、核回归和浅层神经网络)有效。因此,难以研究更广类的非线性模型,包括三层及以上的深度神经网络。本研究中,我们考虑无模型约束的似然最大化问题,并分析了带惩罚估计量的渐近风险上界。在技术上,我们将Fisher信息矩阵的性质与扩展的Marchenko-Pastur律相结合,并将该结合与经验过程技术相关联。所推导的界具有一般性,因为它根据惩罚项描述了双下降与正则化风险曲线。我们的结果在无模型线性特征约束下成立,并允许我们从似然推导出Fisher信息矩阵的一般谱分布。我们展示了若干显式模型,如并行深度神经网络、集成学习和残差网络,均与我们的理论一致。该结果表明,即便大型深度模型,若具备如可分离性的特定结构,其渐近风险也很小。为验证此发现,我们使用并行深度神经网络进行了真实数据实验。我们的结果扩展了渐近风险分析的适用性,并可能有助于深度学习的理解与应用。
引用
@article{arxiv.2103.00500,
title = {Asymptotic Risk of Overparameterized Likelihood Models: Double Descent Theory for Deep Neural Networks},
author = {Ryumei Nakada and Masaaki Imaizumi},
journal= {arXiv preprint arXiv:2103.00500},
year = {2021}
}
备注
36 pages