线性回归模型 MDL 估计量的风险界及其在简单 ReLU 神经网络中的应用
信息论
2024-11-19 v2 math.IT
摘要
为了从最小描述长度 (MDL) 原则的角度研究深度学习的理论基础,我们分析了基于两阶段编码的 MDL 估计量在具有 ReLU 激活函数的简单两层神经网络 (NNs) 上的风险界。为此,我们提出了一种为线性回归模型设计两阶段编码的方法,并基于 Barron 和 Cover (1991) 提出的 MDL 估计量理论,建立了相应 MDL 估计量风险的上界。然后,我们将此结果应用于具有 ReLU 激活函数的简单两层 NNs,该网络由输入层的 个节点、隐藏层的 个节点和一个输出节点组成。由于在我们的设定中,估计对象仅为从隐藏层到输出节点的 个权重,因此这是线性回归模型的一个实例。结果表明,由于神经网络 Fisher 信息矩阵的特征值分布存在严重偏倚(这一事实由 Takeishi 等人 (2023) 证明并在本文中得到细化),所获得的两阶段编码的冗余度很小。也就是说,我们为我们的 MDL 估计量建立了一个紧致的风险上界。注意,我们对简单 ReLU 网络的风险界(其主项为 )与参数数量 无关。
引用
@article{arxiv.2407.03854,
title = {Risk Bounds on MDL Estimators for Linear Regression Models with Application to Simple ReLU Neural Networks},
author = {Yoshinari Takeishi and Jun'ichi Takeuchi},
journal= {arXiv preprint arXiv:2407.03854},
year = {2024}
}